Эксперимент компании Anthropic продемонстрировал способность коллективов искусственного интеллекта к созданию сложного системного программного обеспечения. В рамках проекта шестнадцать автономных агентов на основе модели Claude Opus 4.6 разработали с нуля компилятор для языка программирования C. Эта работа продолжалась две недели и проходила без прямого человеческого управления, при минимальном контроле.
Исследователь Николас Карлини, ведущий специалист в области безопасности машинного обучения, руководил данным проектом. Целью эксперимента был стресс-тест новой методологии, которую в Anthropic называют «командами агентов». Этот подход предполагает, что несколько экземпляров модели Claude могут работать параллельно над общим кодом, самостоятельно координируя свои действия. Для организации процесса Карлини создал специальную программную оболочку. Эта оболочка помещала каждого агента в бесконечный цикл, где он самостоятельно выбирал следующую задачу, решал ее и фиксировал изменения. Всего в ходе работы состоялось около двух тысяч сессий Claude Code, в ходе которых было сгенерировано сто сорок миллионов выходных токенов и потреблено два миллиарда входных токенов. Финансовые затраты на использование API составили приблизительно двадцать тысяч долларов.
Ключевой инженерной задачей стала координация работы шестнадцати параллельных агентов. Каждый агент работал в изолированном Docker-контейнере, имея локальную копию общего Git-репозитория. Для предотвращения конфликтов использовался простой механизм блокировок на основе файловой системы: агент «захватывал» задачу, создавая текстовый файл в специальном каталоге, что сигнализировало остальным агентам о занятости этой работы. После выполнения задачи агент синхронизировал свои изменения с основным репозиторием и снимал блокировку. Несмотря на частые конфликты слияния кода, модель Claude успешно их разрешала. Важным аспектом было проектирование среды, в которой агенты могли бы ориентироваться самостоятельно. Команда разработала комплексные тесты, включая высококачественные наборы тестов для компиляторов и скрипты для сборки проектов с открытым исходным кодом. Для экономии времени и вычислительных ресурсов тест-раннер был оснащен опцией —fast, которая запускала случайную выборку в один или десять процентов от общего числа тестов, что позволяло быстро выявлять регрессии.
Итогом работы стал компилятор объемом около ста тысяч строк кода на языке Rust. Созданное программное обеспечение является чистой реализацией, зависящей только от стандартной библиотеки Rust, и было разработано без доступа к сети Интернет. Компилятор способен компилировать ядро Linux версии 6.9 для архитектур x86, ARM и RISC-V. Он также успешно обрабатывает крупные проекты с открытым исходным кодом, такие как QEMU, FFmpeg, SQLite, PostgreSQL и Redis. В наборах тестов для компиляторов, включая demanding GCC Torture Test Suite, показатель успешного прохождения достигает девяноста девяти процентов. В качестве символического теста компилятор использовался для сборки и запуска видеоигры Doom, что является традиционным неформальным критерием проверки работоспособности компилятора. Однако у созданного компилятора есть ограничения. Например, он не включает 16-разрядный компилятор для x86, необходимый для загрузки Linux в реальном режиме, и для этой цели обращается к внешнему компилятору GCC.
Этот эксперимент служит ориентиром для оценки возможностей современных больших языковых моделей в области автономной разработки. В Anthropic подчеркивают, что проект задумывался как бенчмарк для стресс-тестирования границ возможного. Ранее модель Opus 4 с трудом справлялась с созданием функционального компилятора, а версия 4.5 впервые смогла пройти обширные наборы тестов, но не компилировала крупные реальные проекты. Модель Opus 4.6, выпущенная в феврале 2026 года, показала качественный скачок в способности решать длительные комплексные задачи. Данный успех является частью более широкого тренда развития «агентских» возможностей искусственного интеллекта. Компания Anthropic активно развивает направление мульти-агентных систем, где несколько ИИ-агентов совместно решают сложные проблемы, такие как исследовательский поиск информации. Внутренние оценки компании показывают, что такие системы могут значительно превосходить по эффективности одиночных агентов для задач, требующих параллельного изучения нескольких независимых направлений.
