ИИ-модель Ornith-1.5 сама себя обучила и уже догнала ведущие нейросети мира

Разработчики сделали ставку на самообучение

2 мин.
ИИ-модель Ornith-1.5 сама себя обучила и уже догнала ведущие нейросети мира

Открытая модель Ornith-1.5 предлагает альтернативу привычной гонке за количеством параметров: версия на 9 млрд параметров соперничает с системами в несколько раз крупнее и в отдельных испытаниях обходит их.
Разработчики сделали ставку на самообучение, при котором модель сама придумывает новые задания, ищет решения и совершенствует стратегии через обучение с подкреплением,а компактную версию можно запускать на мобильных устройствах.

Линейка Ornith-1.5 состоит из трёх вариантов на 397 млрд, 35 млрд и 9 млрд параметров. Младшая модель рассчитана на максимально широкое применение. В формате bfloat16 ей требуется 19 ГБ памяти, поэтому для работы хватает одного GPU с 80 ГБ.

Для смартфонов создана квантованная Ornith-1.5-9B-Mobile, совместимая с iPhone и Android. Контекст достигает 262 144 токенов, а технология YaRN позволяет увеличить его до миллиона.

В основе системы лежит замкнутый механизм самостоятельного улучшения. Сначала модель придумывает новые задания, постепенно повышая их сложность по мере собственного развития. Затем она сама формирует набор средств для работы над каждой задачей, то есть инструкции, инструменты, стратегию разделения проблемы на части и прочие элементы.

После этого Ornith-1.5 создаёт несколько вариантов решения, проверяет получившиеся результаты и получает вознаграждение за успешные стратегии. Полученные сигналы идут на обновление модели через обучение с подкреплением. Дальше весь процесс повторяется. Так система одновременно решает задачи и совершенствует методы, с помощью которых учится.

Результаты уже выглядят довольно бодро. Ornith-1.5-9B получила 46,2 балла в Terminal-Bench 2.1 против 21,3 у Qwen3.5-9B. В SWE-bench Verified она набрала 70,6 балла, немного уступив Qwen3.6-35B с результатом 73,4 и заметно опередив Gemma-4-31B dense, которая получила 52 балла.

В тесте научного мышления GPQA Diamond компактная модель набрала 86,4 балла. В агентных испытаниях результат составил 56,4 балла в BrowseComp и 66,5 в ClawEval. По сравнению с предыдущей Ornith-1.0-9B новая версия прибавила 11,6 и 3,4 пункта соответственно.

На старших версиях тот же принцип тоже показывает результат. Ornith-1.5-35B-A3B активирует примерно 3 млрд параметров на каждый токен, но получила 68,5 балла в Terminal-Bench 2.1 и 79 в SWE-bench Verified. У Qwen3.6-35B-A3B показатели составили 49,2 и 73,4 балла.

Флагманская Ornith-1.5-397B набрала 86,1 балла в Terminal-Bench 2.1 и 56 в DeepSWE. Для сравнения, Claude Opus 4.8 получил 85 и 59 баллов. Выходит, идея с самостоятельным улучшением работает не только в компактном формате, но и сохраняет эффективность при увеличении размера модели.

Для разработчиков интерес Ornith-1.5 прежде всего связан с расходами на запуск. Если система с 9 млрд параметров способна программировать, рассуждать и работать с инструментами на уровне куда более крупных моделей, мощные ИИ-системы становятся доступнее без огромных вычислительных кластеров.