Компания Anthropic опубликовала научную работу, описывающую метод автоматизированного исследования выравнивания. Подход предполагает использование большой языковой модели Claude 3.5 Sonnet в качестве автоматического исследователя, который генерирует обучающие данные и оценивает поведение других систем. Это позволяет заменить труд людей-аннотаторов на этапе тонкой настройки моделей. Согласно данным из статьи, автоматизированный пайплайн справляется с задачами выявления сбоев выравнивания в четыре раза быстрее и обходится в десять раз дешевле традиционного привлечения экспертов.
В эксперименте модель-учитель на базе Claude 3.5 Sonnet обучала целевую модель Claude 3 Haiku корректировать нежелательные ответы, связанные с насилием, дезинформацией и уклонением от инструкций. Система автоматически генерировала контрпримеры и синтетические предпочтения, после чего применяла алгоритм обучения с подкреплением на основе обратной связи от ИИ (RLAIF). Точность выявления нарушений политики безопасности достигла 95 процентов, тогда как люди-аннотаторы показывали 92 процента. Стоимость обработки одного примера снизилась с 0,12 доллара до 0,01 доллара, а время сократилось с 30 секунд до 2 секунд. Пропускная способность автоматизированной системы составила до 10 тысяч примеров в час.
Технически решение функционирует как цикл автоматического исследователя. Claude 3.5 Sonnet получает ответ целевой модели, анализирует его на соответствие принципам безопасности, заложенным в системный промпт, генерирует критику и исправленный вариант. На основе синтетических пар «нежелательный ответ – исправленный ответ» формируется датасет предпочтений для дообучения целевой модели методом прямого предпочтения (DPO) или обучения с подкреплением. В эксперименте было сгенерировано 16 тысяч примеров, охватывающих 12 категорий нарушений. Обучение Claude 3 Haiku на этих данных заняло около трёх часов на кластере из 128 ускорителей NVIDIA H100. Для сравнения, аналогичный объём ручной разметки потребовал бы работы 20 аннотаторов в течение недели и стоил бы порядка 20 тысяч долларов, тогда как затраты на вычислительные ресурсы для автоматического метода не превысили 500 долларов.
Предложенный метод развивает идеи Constitutional AI и RLHF, исключая человека из цикла обратной связи. Ранее Anthropic уже применяла конституционный подход для обучения Claude, однако формирование принципов и разметка данных требовали значительных человеческих ресурсов. Новый автоматизированный исследователь самостоятельно формулирует критерии оценки и создаёт наборы данных, адаптируясь к новым типам нежелательного поведения. Исследователи отмечают, что такой подход критически важен для масштабирования безопасности по мере роста возможностей моделей.
Аналогичные работы ведут OpenAI и Google DeepMind. OpenAI использует модель GPT-4 для пошаговой верификации рассуждений, а DeepMind разрабатывает системы самопроверки на основе игры. Решение Anthropic отличается полной автоматизацией генерации обучающих сигналов и ориентацией на исправление сбоев выравнивания без участия человека. Научная работа опубликована на платформе ArXiv и сопровождается открытыми наборами синтетических данных. В Anthropic заявили, что метод будет использован при обучении будущих моделей семейства Claude, что позволит ускорить цикл обновления систем безопасности и снизить зависимость от ручной разметки.
9 часов назад 1 сентября 2026 в 23:43 2741
