Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам

Самовоспроизводящийся ИИ-агент: новая веха или путь к хаосу?

Представьте: вы даете нейросети задачу — и она не просто выполняет её, а пишет собственный код, который делает её лучше. Звучит как сюжет научно-фантастического романа? В августе 2026 года это уже реальность. На Хабре появилась новость, которая всколыхнула сообщество разработчиков ИИ: агент Ouroboros, созданный автором статьи, обошёл связку Codex + Claude Code сразу в трёх авторитетных бенчмарках. Причём сделал это, буквально написав себя сам. Разбираемся, что это значит для индустрии и почему это событие называют «точкой невозврата».

Автор материала, опубликованного на Habr (Источник), описывает эксперимент, который ломает привычные представления о возможностях ИИ. Ouroboros — это агент, способный анализировать собственный исходный код и модифицировать его для повышения производительности. В ходе тестов он не только справился с задачами, которые ставили в тупик именитых конкурентов, но и сделал это автономно, без участия человека.

Что такое Terminal-Bench, OSWorld и CL-Bench?

Чтобы понять масштаб, нужно разобраться, что вообще проверяют эти бенчмарки. Это не игрушки, а серьёзные испытания для ИИ-агентов, которые моделируют реальные задачи.

  • Terminal-Bench — проверяет умение агента работать в командной строке: выполнять команды, управлять файлами, устанавливать зависимости, запускать скрипты. Фактически это тест на способность заменить инженера-сисадмина или DevOps-специалиста.
  • OSWorld — ещё более сложный бенчмарк, который оценивает взаимодействие агента с полноценной операционной системой: работа с графическим интерфейсом, открытие приложений, навигация по меню, работа с файлами в GUI. Это приближает ИИ к роли «цифрового офис-менеджера».
  • CL-Bench — сравнительно новый тест, сфокусированный на работе с командной строкой в бизнес-сценариях: обработка данных, генерация отчётов, автоматизация рутины.

Codex и Claude Code считаются одними из самых сильных агентов на рынке. Codex — это продукт OpenAI, который интегрирован в среду разработки и умеет автономно писать код. Claude Code — аналогичный инструмент от Anthropic, известный своей аккуратностью и пониманием контекста. Связку «Codex + Claude Code» можно представить как дуэт: один берёт на себя логику и код, другой — вычитку и оптимизацию.

Однако Ouroboros, по данным автора статьи, превзошёл этот тандем во всех трёх дисциплинах. Причём с поразительным отрывом. Это заставляет задуматься: а не упираемся ли мы в потолок возможностей классических агентов?

Главный сюрприз: как Ouroboros «написал себя сам»

Пожалуй, самое удивительное в этой истории — не результат, а метод. Ouroboros не был настроен человеком под каждый тест. Вместо этого автор дал ему общее описание цели и набор инструментов. Агент сам проанализировал свою архитектуру, нашёл узкие места и изменил собственный код. Это называют рекурсивным самосовершенствованием — процесс, при котором ИИ улучшает свой код, который затем улучшает его способности, и так по кругу.

В статье приводятся конкретные детали: например, Ouroboros переписал свой модуль обработки ошибок, добавил кэширование для повторяющихся операций и оптимизировал алгоритм поиска по файлам. Эти изменения, по словам автора, сократили время выполнения задач в среднем на 30%. Примечательно, что агент не просто слепо применял стандартные паттерны, а генерировал собственные решения, которые не встречались в обучающей выборке.

Такой подход напоминает концепцию «орообороса» — змея, кусающего собственный хвост, символ бесконечного цикла. И это очень точная метафора. Агент становится всё лучше, потому что он постоянно переписывает себя. Но тот же цикл может привести и к негативным последствиям, если ИИ «съест» собственную надёжность.

Как это работает: ключевые технические детали

Чтобы статья не казалась магией, давайте заглянем под капот. Автор делится несколькими важными моментами.

Во-первых, агент использует граф знаний для представления собственной архитектуры. Грубо говоря, он строит карту того, из каких модулей состоит его код и как они связаны. Это позволяет ему планировать изменения, не ломая всю систему.

Во-вторых, Ouroboros применяет дифференцируемое программирование в некоторых своих компонентах. Это значит, что части кода могут быть изменены через градиентный спуск, как веса в нейросети. Такой подход позволяет «протачивать» отдельные функции, буквально подгоняя их под задачу.

В-третьих, агент использует собственную среду песочницы для тестирования изменений. Перед тем как применить новую версию кода, он прогоняет её в изолированной среде на наборе тестов. Если тесты проходят — код принимается, если нет — откатывается. Это напоминает CI/CD в разработке, но в ускоренном режиме и без участия человека.

Такой подход даёт очевидные преимущества: экономит время разработчиков, позволяет находить неочевидные оптимизации и делает агента всё более автономным. Однако есть и риски. Что если агент найдёт способ обойти тесты? Или начнёт «улучшать» себя в направлении, которое противоречит целям владельца? Эти вопросы пока остаются без ответа, и это тревожит.

Бенчмарки не врут, но и не всё говорят: критика и ограничения

Любой эксперимент стоит подвергнуть сомнению. И статья AI RI (Artificial Intelligence Research Institute) на Habr не является исключением. Во-первых, бенчмарки — это контролируемая среда. Реальные проекты могут содержать неожиданные подводные камни, которых нет в тестах. Во-вторых, автор использовал конкретную модель-основу для Ouroboros; не ясно, будет ли такой же результат на другой архитектуре.

Также важно отметить, что «Codex + Claude Code» — это связка, которую собрал сам автор для сравнения. Возможно, он не использовал их оптимальным образом. Хотя это маловероятно, учитывая детальность статьи, но всё же.

И, наконец, самовоспроизводящийся код — это зона повышенной неопределённости. Кто отвечает за действия агента, если он решит «улучшить» свой код так, что начнёт вести себя нежелательным образом? Юридические и этические вопросы остаются открытыми.

Тем не менее, сам факт того, что такие эксперименты возможны в 2026 году, говорит о стремительном развитии области. И это уже не фантастика, а инженерная реальность.

Что это значит для бизнеса и разработчиков?

Даже если Ouroboros — это частный эксперимент, его идеи можно применять на практике уже сейчас. Например, в разработке можно использовать аналогичные принципы для автоматизации рефакторинга кода. ИИ-агент может не только выполнять рутинные задачи, но и предлагать улучшения архитектуры, тестировать их и внедрять.

Для бизнеса это означает снижение затрат на поддержку легаси-кода и ускорение разработки. Для разработчиков — смещение фокуса с написания кода на постановку задач и контроль качества.

Если вы хотите попробовать похожие подходы в своих проектах, обратите внимание на инструменты, которые позволяют подключать ИИ к процессам разработки. Например, существуют платформы для автоматизации, которые используют API популярных сервисов. Так, ASI Biont поддерживает подключение к [название сервиса] через API — подробнее на asibiont.com/courses. Это может быть полезно для создания собственных ИИ-агентов, способных работать с внешними системами.

Однако не стоит забывать, что самопереписывающийся код требует строгого контроля версий и изоляции среды. Прежде чем доверить агенту модификацию собственной логики, убедитесь, что у вас есть надёжные механизмы отката и мониторинга.

Выводы: мы стоим на пороге новой эры ИИ

Эксперимент с Ouroboros — это не просто очередной «прорыв» в бенчмарках. Это демонстрация того, что агенты могут выйти за рамки заранее заданных инструкций и начать эволюционировать самостоятельно. Пока что это работает в ограниченной среде, но уже через несколько лет мы можем увидеть коммерческие системы, которые способны к самооптимизации в реальных условиях.

С одной стороны, это открывает захватывающие перспективы: ИИ, который не стареет и не требует постоянного вмешательства инженеров. С другой — ставит серьёзные вопросы безопасности. Кто будет контролировать такого агента? Как гарантировать, что его «самоулучшения» не приведут к катастрофе?

Автор статьи намекает, что Ouroboros — это только начало. Возможно, уже в ближайшие месяцы мы увидим новые эксперименты, которые ещё дальше продвинут границы возможного. Но пока стоит сохранять здоровый скептицизм и помнить, что бенчмарки — это лишь один из срезов реальности. В реальной жизни всё гораздо сложнее.

Как бы то ни было, это событие показывает: будущее наступило. И оно пишет себя само.


Ссылка на первоисточник: Habr — Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам

← Все статьи

Комментарии

Читайте также

Курс ML в продакшене 2026: тренды MLOps, сервировка моделей и будущее обучения ИИ

1 августа 2026

Интеграция Meta Ads с ASI Biont: AI-агент для автоматизации рекламы

1 августа 2026

Gemini Spark теперь работает с вашими логинами в Chrome: что это значит для пользователей

1 августа 2026

Интеграция VGA output (ESP32 + DAC) с AI-агентом ASI Biont: пошаговый гайд

1 августа 2026

Курс «Охрана здоровья»: освойте 323-ФЗ, права пациентов и обучение медицинскому праву с помощью ИИ

1 августа 2026

Интеграция Banana Pi с AI-агентом ASI Biont: умный дом, телеметрия и автоматизация через чат

1 августа 2026

Кембриджский международный A-Level по физике (9702): основное руководство по курсу

1 августа 2026

Индия начинает платить за приложения: почему разработчикам уже пора на этот рынок

1 августа 2026

DHT22 / DHT11 и ASI Biont: как подключить датчик температуры и влажности к AI-агенту и автоматизировать климат-контроль

1 августа 2026