Исследовательская группа Thinking Machines Lab, созданная бывшим техническим директором OpenAI Мирой Мурати при участии фонда Bridgewater Associates, завершила масштабное тестирование больших языковых моделей на задачах финансового отбора. Коммерческие системы GPT, Claude и Gemini продемонстрировали точность в диапазоне 50–70 процентов. Этот показатель оказался ниже минимального порога доверия в 80 процентов, который применяется для реальных бизнес-процессов. В то же время открытая модель Qwen3-235B, дообученная и оптимизированная инженерами лаборатории, достигла точности 84,7 процента. Затраты на инфраструктуру для её работы оказались в 14 раз меньше, чем у сопоставимых по классу проприетарных аналогов.
Лаборатория Thinking Machines Lab была основана в начале 2025 года. Её ключевая цель — разработка узкоспециализированных систем искусственного интеллекта для финансового сектора. Организация объединила экспертов в области машинного обучения и управления инвестициями, а стратегическая поддержка Bridgewater обеспечила доступ к массивам корпоративных данных и вычислительным ресурсам для экспериментов.
Модель Qwen3-235B, ставшая основой теста, принадлежит семейству Qwen3, представленному Alibaba Cloud в апреле 2025 года. Она использует архитектуру Mixture of Experts с общим числом параметров 235 миллиардов и 22 миллиардами активных параметров на один токен. Thinking Machines Lab применила к базовой версии процедуру дополнительного обучения на специализированных финансовых корпусах. В выборку вошли годовые и квартальные отчёты компаний из баз SEC, транскрипты конференц-звонков, макроэкономические сводки и исторические данные о рыночных котировках. Файн-тюнинг проводился с упором на задачи извлечения числовых показателей, интерпретации бухгалтерских примечаний и оценки рисков на основе неструктурированного текста. Полученная версия не меняла фундаментальную архитектуру, однако её выходные распределения были скорректированы под строгие требования финансового анализа.
Методология тестирования исключала субъективные оценки. Использовался закрытый бенчмарк, сформированный аналитиками лаборатории, который включал сотни сценариев анализа корпоративной отчётности и прогнозирования. Каждый ответ проверялся по эталонным экспертным заключениям. Коммерческие модели тестировались через их актуальные API в одинаковых условиях. Порог 80 процентов был определён на основе требований к допустимому уровню ошибки в инвестиционных процессах и комплаенс-процедурах.
Показатель в 84,7 процента, достигнутый дообученной Qwen3-235B, сопровождался значительным экономическим преимуществом. Инференс модели выполнялся на кластере из восьми ускорителей NVIDIA H100, тогда как для развёртывания сравнимых по пропускной способности закрытых систем, по оценкам лаборатории, требуется пул ресурсов, чья стоимость в 14 раз выше. Эта разница объясняется не только меньшим числом задействованных устройств, но и снижением накладных расходов на маршрутизацию запросов и отсутствием лицензионных отчислений.
Результат Thinking Machines Lab фиксирует перелом на рынке финансового ИИ: доменная специализация открытых моделей впервые позволяет превзойти универсальные коммерческие системы при одновременном сокращении затрат на порядок. Лаборатория объявила о намерении опубликовать методику тонкой настройки и поделиться оптимальными конфигурациями, что может ускорить внедрение подобных решений в управлении активами, кредитном анализе и аудите.
2 дня назад 23 июля 2026 в 5:33 11550
