Исследователи из Института интеллектуальных систем Общества Макса Планка в Тюбингене создали языковую модель LittleLearner, обученную только на материалах, соответствующих американской программе начальной школы — с первого по пятый класс. Эксперимент должен помочь отделить способности, действительно приобретённые моделью при обучении, от сведений, которые она могла обнаружить в огромных и плохо контролируемых массивах данных.
Корпус с заранее заданными границами
LittleLearner — модель с 5 млрд параметров, разработанная Ли, Целлером и их коллегами. Для неё авторы подготовили корпус LittleCurriculum объёмом 88 млрд токенов. Данные прошли пять этапов фильтрации, чтобы содержание соответствовало знаниям, доступным ученику начальной школы.
Из набора исключили темы и формулировки, выходящие за эти рамки: в частности, материалы по абстрактной алгебре, физике более высокого уровня и геополитике. Параллельно исследователи обучили контрольную модель на сопоставимом объёме токенов, но без такого фильтра.
Обычные большие языковые модели получают информацию из обширных интернет-данных, поэтому трудно установить происхождение конкретного навыка или ответа. В случае LittleLearner границы исходных знаний заданы заранее и могут быть проверены, что делает эксперимент пригодным для исследования механизмов обучения моделей.
Масштаб не отменил ограничения данных
Авторы проверили три способа расширить возможности LittleLearner за пределами первоначальной программы: увеличение размера модели, дообучение на примерах из более сложных областей и использование продвинутых подсказок. Согласно результатам работы, эти подходы улучшали выполнение заданий в пределах уже освоенного материала, но не дали существенного роста компетенций за его границами.
Иными словами, более крупная версия модели лучше справлялась с задачами уровня начальной школы, однако сама по себе не переходила к знаниям следующей образовательной ступени. Исследование не доказывает наличие универсального предела для глубокого обучения и не оценивает способности всех существующих ИИ-систем. Однако оно показывает, что масштабирование параметров не обязательно компенсирует отсутствие нужных знаний в обучающих данных.
Инструмент для исследований
LittleLearner задуман не как универсальный помощник, а как контролируемая исследовательская среда. На ней можно изучать, каким образом языковые модели усваивают сведения, обобщают их и применяют в новых задачах. В частности, авторы предлагают сравнивать траектории обучения моделей и детей на сопоставимых заданиях.
Модель доступна на сайте проекта. Авторы отмечают, что она уверенно отвечает на вопросы в пределах начального школьного курса, но ограничена при запросах о темах, не входивших в её образовательный контекст, например о ядерных реакциях.
Препринт исследования опубликован на платформе arXiv под названием LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure («LittleLearner: языковые модели в условиях педагогически контролируемого доступа к знаниям»).
Мнение редакции
LittleLearner ценен не размером и не практической универсальностью, а прозрачностью своих ограничений. В гонке за всё более крупными моделями этот опыт возвращает в центр внимания качество, состав и происхождение обучающих данных. Способность системы ясно обозначать границу собственных знаний может оказаться важнее уверенного ответа на любой вопрос — особенно там, где цена ошибки высока.