tenzorНачать
Все статьи

Модель, которая предсказывает не слово, а мысль: что такое Next Concept Prediction

Все привычные языковые модели устроены одинаково: они предсказывают следующий кусочек текста. Написали «Москва — столица», модель прикидывает, что дальше идёт «России». Потом следующий кусочек, потом ещё. Из миллиардов таких угадываний и складывается способность разговаривать.

Новая работа, которая на этой неделе собрала больше всего внимания среди свежих исследований, предлагает добавить к этому второй уровень: пусть модель предсказывает не только следующий кусочек слова, но и следующее понятие.

Модель предсказывает понятие целиком, а не отдельные слова

В чём проблема предсказания по словам

Представьте, что человек думает исключительно вперёд на одно слово. Чтобы построить сложную фразу, ему приходится удерживать замысел где-то в голове, но проговаривать его строго по кусочку. Примерно так и работает обычная модель: замысел живёт внутри её скрытых состояний, а наружу выдаётся по одному токену.

Отсюда известные слабости. Модель может красиво начать мысль и не довести её. Может увести длинное рассуждение в сторону, потому что каждый шаг выбирался локально. На обучении это тоже сказывается: задача «угадать следующий кусочек» слишком лёгкая, из неё модель извлекает меньше пользы за каждый прочитанный текст.

Что предлагают вместо этого

Модель назвали NCP-ArchPreview. Она делает две вещи одновременно.

Первая — привычное предсказание следующего токена, никуда оно не делось. Вторая — предсказание концепта: смыслового блока, который покрывает сразу несколько токенов. Словарь таких концептов модель строит себе сама, прямо из своих внутренних состояний, а не получает готовым от человека.

Дальше самое интересное. Предсказанный концепт не остаётся отдельной веткой: он возвращается обратно на уровень слов и направляет дальнейшую генерацию. Модель как бы сначала намечает, куда идёт мысль, и только потом её проговаривает.

Два уровня предсказания: следующее слово и следующее понятие

Аналогия

Обычная модель похожа на человека, который печатает без плана и держит замысел в уме. Модель с предсказанием понятий сначала набрасывает следующий пункт плана, а потом пишет под него слова. Оба уровня обучаются вместе, одной цепочкой.

Что это дало на замерах

Модель обучили до 8,9 миллиарда параметров на 5,73 триллиона слов-кусочков — это самая крупная на сегодня демонстрация подхода, где модель мыслит в скрытом пространстве, а не только в словах.

Главная цифра релиза: тот же уровень обученности, что у сопоставимой модели OLMo-3-7B, достигнут на 51,3% от общего объёма данных. Грубо говоря, вдвое меньше прочитанных текстов ради того же результата. После полного обучения модель обходит базовую и по прикладным задачам.

Для отрасли это ценно ровно по одной причине — деньги. Обучение крупной модели стоит десятки миллионов долларов, и большая часть суммы уходит на прогон данных. Вдвое меньше прогонов при том же качестве заметно меняет экономику.

Тот же уровень обученности достигнут на половине данных

Значит ли это, что модели поумнеют

Не сразу и не автоматически. Тут стоит быть осторожным.

Работа показывает, что подход масштабируется и даёт выигрыш в эффективности обучения. Она не показывает, что модель стала принципиально лучше рассуждать или перестала ошибаться. Проверок пока мало, сравнение идёт с открытой моделью среднего размера, а не с флагманами.

Но направление любопытное. Последние годы прогресс шёл в основном за счёт размера: больше параметров, больше данных, больше видеокарт. Работы вроде этой пробуют менять сам способ обучения — и если такие идеи приживутся, следующее поколение моделей может оказаться не крупнее, а устроенным иначе.

Что с этого обычному пользователю

Напрямую — ничего, NCP-ArchPreview нельзя открыть и что-то в ней спросить, это исследовательская модель. Косвенно — довольно много.

Удешевление обучения довольно быстро доходит до цены за тысячу токенов. Ровно так это работало с дистилляцией: сначала научились переносить умения крупной модели в мелкую, а через год дешёвые модели в каталогах стали отвечать не хуже вчерашних флагманов. Здесь может случиться то же самое.

Что такое концепт в этой модели?+

Смысловой блок, покрывающий несколько токенов сразу. Словарь таких блоков модель строит сама из своих внутренних состояний, а не получает от человека.

Чем это отличается от обычного предсказания следующего слова?+

Обычная модель делает шаг за шагом по кусочкам текста. Здесь к этому добавлен второй уровень: модель заранее намечает следующее понятие и направляет им генерацию слов.

Модель стала умнее?+

Проверено другое: тот же уровень обученности достигается примерно вдвое дешевле по данным. Прирост качества рассуждений в работе не заявлен.

Когда это появится в доступных сервисах?+

Сроков нет. Это исследовательская работа, до продуктов такие идеи доходят обычно через поколение моделей.

Что дальше почитать

Сравните модели на своей задаче

Разница между дешёвой и сильной моделью заметнее всего на том, что вы делаете каждый день.

Открыть чат