Сотрудники и исследователи OpenAI сообщили, что компания приближается к ключевой цели — созданию ИИ-агентов, которые управляют компьютерами и веб-браузерами на уровне человека. Данные из соглашений о неразглашении, опубликованные порталом ITHome, указывают на комбинацию прямого низкоуровневого чтения данных веб-страниц с продвинутыми процессами обучения. Это позволит автоматизировать рутинные задачи и тестирование программного обеспечения без участия оператора.
В январе 2025 года OpenAI представила исследовательский предпросмотр Operator — агента на базе модели Computer-Using Agent (CUA). CUA использует архитектуру GPT-4o, которая обучена взаимодействовать с графическим интерфейсом через серию скриншотов. Агент распознаёт элементы интерфейса, выполняет виртуальные клики, ввод текста и скроллинг, имитируя действия пользователя. Однако текущая версия полагается исключительно на визуальный анализ, что ограничивает точность в сложных сценариях с динамическим контентом и нестандартными элементами вёрстки.
Новый подход из утечки предполагает интеграцию прямого доступа к структурным данным страницы — DOM-дереву или Accessibility Tree. Это устраняет зависимость от визуального распознавания и повышает надёжность при работе с одностраничными приложениями, капчами и часто обновляемыми интерфейсами. Источник, близкий к команде разработки, подтвердил, что инженеры OpenAI тестируют гибридную модель, которая объединяет анализ скриншотов с низкоуровневым чтением кода страницы. Подобный метод уже применяется в академических проектах, но коммерческая реализация способна радикально улучшить показатели выполнения многозвенных задач.
Конкуренты движутся в сходных направлениях. Google разрабатывает Project Mariner на основе Gemini 2.0, который также работает через браузер, но использует древовидное представление интерфейса для навигации. Anthropic предлагает функцию Computer Use для Claude, оперирующую скриншотами и эмулирующую движения мыши. Стартап Adept, вошедший в состав Amazon, создавал агента ACT-1, ориентированного на прямую манипуляцию элементами через DOM. Решение OpenAI, согласно инсайду, будет сочетать сильные стороны обоих подходов — визуальное понимание контекста и детерминированное взаимодействие с кодом страницы.
В тесте WebVoyager, который оценивает способность агентов решать практические задачи на реальных сайтах, Operator успешно выполнил 87 процентов заданий. Для сравнения, большинство аналогичных агентов демонстрируют результаты в диапазоне от 50 до 70 процентов. Google сообщал, что Project Mariner достигает 83,5 процента успеха в собственных внутренних бенчмарках. Новый метод прямого чтения данных может поднять точность Operator выше 95 процентов, считают осведомлённые источники.
Доступ к Operator пока ограничен подписчиками ChatGPT Pro в США стоимостью 200 долларов в месяц. Агент функционирует в изолированной облачной среде на базе контейнеров, что обеспечивает безопасность, но добавляет задержки при рендеринге страниц. Ожидается, что после внедрения низкоуровневого доступа к структуре документа время отклика сократится, а стоимость обработки одного действия снизится. OpenAI планирует расширить географию предоставления услуги и интегрировать агента в API для корпоративных клиентов, которым требуются автоматизация тестирования веб-интерфейсов и мониторинг транзакций.
Разработка браузерных агентов остаётся частью стратегии OpenAI по созданию многоступенчатых автономных систем. Генеральный директор Сэм Альтман ранее назвал 2025 год периодом, когда агенты начнут реально работать. Конкуренция на рынке обостряется: Microsoft внедряет Copilot Vision в браузер Edge, Apple разрабатывает Apple Intelligence с функцией экранного контекста для iOS. Успех OpenAI в объединении визуального и структурного анализа может определить стандарт для следующего поколения автоматизации пользовательских задач. Новая информация подтверждает, что компания движется к выпуску более совершенного агента, который выполняет сложные цепочки действий в браузере без вмешательства человека.
1 день назад 21 августа 2026 в 15:07 10373
