Модель, которая предсказывает не слово, а мысль: что такое Next Concept Prediction
Все привычные языковые модели устроены одинаково: они предсказывают следующий кусочек текста. Написали «Москва — столица», модель прикидывает, что дальше идёт «России». Потом следующий кусочек, потом ещё. Из миллиардов таких угадываний и складывается способность разговаривать.
Новая работа, которая на этой неделе собрала больше всего внимания среди свежих исследований, предлагает добавить к этому второй уровень: пусть модель предсказывает не только следующий кусочек слова, но и следующее понятие.
В чём проблема предсказания по словам
Представьте, что человек думает исключительно вперёд на одно слово. Чтобы построить сложную фразу, ему приходится удерживать замысел где-то в голове, но проговаривать его строго по кусочку. Примерно так и работает обычная модель: замысел живёт внутри её скрытых состояний, а наружу выдаётся по одному токену.
Отсюда известные слабости. Модель может красиво начать мысль и не довести её. Может увести длинное рассуждение в сторону, потому что каждый шаг выбирался локально. На обучении это тоже сказывается: задача «угадать следующий кусочек» слишком лёгкая, из неё модель извлекает меньше пользы за каждый прочитанный текст.
Что предлагают вместо этого
Модель назвали NCP-ArchPreview. Она делает две вещи одновременно.
Первая — привычное предсказание следующего токена, никуда оно не делось. Вторая — предсказание концепта: смыслового блока, который покрывает сразу несколько токенов. Словарь таких концептов модель строит себе сама, прямо из своих внутренних состояний, а не получает готовым от человека.
Дальше самое интересное. Предсказанный концепт не остаётся отдельной веткой: он возвращается обратно на уровень слов и направляет дальнейшую генерацию. Модель как бы сначала намечает, куда идёт мысль, и только потом её проговаривает.
Аналогия
Обычная модель похожа на человека, который печатает без плана и держит замысел в уме. Модель с предсказанием понятий сначала набрасывает следующий пункт плана, а потом пишет под него слова. Оба уровня обучаются вместе, одной цепочкой.
Что это дало на замерах
Модель обучили до 8,9 миллиарда параметров на 5,73 триллиона слов-кусочков — это самая крупная на сегодня демонстрация подхода, где модель мыслит в скрытом пространстве, а не только в словах.
Главная цифра релиза: тот же уровень обученности, что у сопоставимой модели OLMo-3-7B, достигнут на 51,3% от общего объёма данных. Грубо говоря, вдвое меньше прочитанных текстов ради того же результата. После полного обучения модель обходит базовую и по прикладным задачам.
Для отрасли это ценно ровно по одной причине — деньги. Обучение крупной модели стоит десятки миллионов долларов, и большая часть суммы уходит на прогон данных. Вдвое меньше прогонов при том же качестве заметно меняет экономику.
Значит ли это, что модели поумнеют
Не сразу и не автоматически. Тут стоит быть осторожным.
Работа показывает, что подход масштабируется и даёт выигрыш в эффективности обучения. Она не показывает, что модель стала принципиально лучше рассуждать или перестала ошибаться. Проверок пока мало, сравнение идёт с открытой моделью среднего размера, а не с флагманами.
Но направление любопытное. Последние годы прогресс шёл в основном за счёт размера: больше параметров, больше данных, больше видеокарт. Работы вроде этой пробуют менять сам способ обучения — и если такие идеи приживутся, следующее поколение моделей может оказаться не крупнее, а устроенным иначе.
Что с этого обычному пользователю
Напрямую — ничего, NCP-ArchPreview нельзя открыть и что-то в ней спросить, это исследовательская модель. Косвенно — довольно много.
Удешевление обучения довольно быстро доходит до цены за тысячу токенов. Ровно так это работало с дистилляцией: сначала научились переносить умения крупной модели в мелкую, а через год дешёвые модели в каталогах стали отвечать не хуже вчерашних флагманов. Здесь может случиться то же самое.
Что такое концепт в этой модели?+
Смысловой блок, покрывающий несколько токенов сразу. Словарь таких блоков модель строит сама из своих внутренних состояний, а не получает от человека.
Чем это отличается от обычного предсказания следующего слова?+
Обычная модель делает шаг за шагом по кусочкам текста. Здесь к этому добавлен второй уровень: модель заранее намечает следующее понятие и направляет им генерацию слов.
Модель стала умнее?+
Проверено другое: тот же уровень обученности достигается примерно вдвое дешевле по данным. Прирост качества рассуждений в работе не заявлен.
Когда это появится в доступных сервисах?+
Сроков нет. Это исследовательская работа, до продуктов такие идеи доходят обычно через поколение моделей.
Что дальше почитать
- Почему нейросети похожи друг на друга — про дистилляцию и то, как умения крупных моделей попадают в дешёвые.
- Модели для чата — что доступно сейчас и сколько стоит тысяча токенов.
Сравните модели на своей задаче
Разница между дешёвой и сильной моделью заметнее всего на том, что вы делаете каждый день.
Открыть чат