5 часов назад 29 июля 2026 в 1:17 1172

Исследовательское агентство 404 Media сообщило о новой практике разработчиков генеративного искусственного интеллекта. Для защиты обучающих массивов от загрязнения синтетическим контентом компании массово приобретают физические тиражи книг, изданных до 2022 года. Причиной стал эффект коллапса моделей: когда алгоритмы обучаются на текстах, которые создали другие нейросети, они быстро деградируют и теряют связность.
Технические подробности раскрыли отраслевые источники Ars Technica и Wired. Проблема наследования ошибок при рекурсивном обучении описана в работе группы Шумайлова из Оксфордского университета в мае 2023 года. Исследователи показали, что после пятого-шестого цикла переобучения на собственных выходах большие языковые модели начинают генерировать бессмысленный повторяющийся текст. Доля низкокачественного автоматически сгенерированного контента в интернете неуклонно растет, и традиционные датасеты, полученные веб-краулингом Common Crawl, теряют репрезентативность. На этом фоне бумажные издания, выпущенные до широкого распространения ChatGPT и аналогичных систем, рассматриваются как источник данных без синтетических примесей.
По данным 404 Media, оцифровка поставлена на поток. Стартапы выкупают у букинистических складов и частных продавцов партии томов, вышедших до 2022 года. Книги доставляют в центры обработки, где переплет удаляют механическими гильотинными резаками. Стопки отдельных листов загружают в скоростные документ-сканеры с автоматической подачей, такие как Fujitsu fi-7900 или аналогичные промышленные модели, которые обрабатывают до 450 страниц в минуту при оптическом разрешении 300 точек на дюйм. Сканы проходят оптическое распознавание символов движками ABBYY FineReader или Tesseract OCR, после чего сложные фрагменты верифицируют вручную. Собеседники издания оценивают среднюю стоимость полного цикла сканирования одного тома в сумму от 20 до 30 долларов США.
Приоритет отдают научной фантастике, техническим справочникам, академическим монографиям и художественной прозе ведущих авторов. Такой выбор обусловлен стилистическим разнообразием и богатством фактологии, которые нужны для тонкой настройки базовых моделей. В отличие от пиратских библиотек вроде Books3, содержавшей порядка 196 тысяч книг в составе датасета The Pile, новый подход подразумевает легальное владение физическим носителем. При этом юристы указывают, что неопределенность в отношении использования оцифрованных текстов для коммерческого обучения алгоритмов сохраняется.
Эксперты отмечают, что тенденция отражает фундаментальный сдвиг в стратегиях сбора данных. Если на ранних этапах развития генеративного ИИ акцент делали на объеме и дешевизне получения текстов из открытого интернета, то теперь ценность приобретают верифицированное происхождение и отсутствие синтетических примесей. Некоторые лаборатории финансируют оцифровку редких фондов библиотек на условиях получения эксклюзивного доступа к цифровым копиям. Спрос на чистые аналоговые источники будет расти пропорционально экспансии контента, который создают нейросети, и к концу текущего года может сформироваться отдельный рынок сертифицированных датасетов.

Никто не прокомментировал материал. Есть мысли?