Как устроена GPT-6 Astra: зацикленные трансформеры простыми словами
Себастьян Рашка разобрал, как может быть устроена GPT-6 Astra, и текст за сутки стал самым читаемым техническим материалом на Hacker News. Тема звучит страшно — «зацикленные трансформеры», «скрытые рассуждения». На деле идея простая, и понимать её полезно: от неё напрямую зависит, почему одни модели отвечают за секунду и стоят копейки, а другие думают минуту и стоят в двадцать раз дороже.
Как работает обычная модель
Языковая модель — это стопка одинаковых по устройству слоёв. Текст заходит снизу, проходит слой за слоем вверх, и на выходе получается следующий кусочек ответа. Чем больше слоёв, тем «глубже» модель может обдумать вход, и тем больше в ней весов, которые надо хранить и обучать.
Отсюда простое правило последних лет: хочешь модель умнее — делай стопку выше. Проблема в том, что каждый новый слой добавляет памяти и денег.
Что меняет петля
Зацикленный трансформер вместо новых слоёв прогоняет вход через одну и ту же стопку несколько раз. Один из примеров в разборе: 22 блока применяются дважды, и получается глубина в 44 прохода при памяти на 22 блока.
Аналогия близкая к жизни: вы не нанимаете второго бухгалтера, а просите того же самого пройти отчёт ещё раз, свежим взглядом. Людей в штате столько же, работы сделано вдвое больше — и времени ушло вдвое больше.
Экономия здесь только на весах. Вычислений столько же, сколько у высокой стопки, а на обучении разница небольшая: в исследовании SMELT зацикленные варианты требовали на 7–18% меньше вычислений при том же качестве.
Что известно про саму Astra
Прямо OpenAI ничего не подтверждала. Главная зацепка — фраза их научного руководителя: глубина вычислительного графа у нынешних флагманов, включая Astra, отличается от GPT-4 не больше чем вдвое. При том что модель заметно сильнее, это косвенно намекает на петли: глубина работы выросла не за счёт роста стопки.
Что известно по результатам: Astra особенно хороша в трёхмерной графике и берёт 99,9% на бенчмарке ARC-AGI-3 против 7,8% у предыдущего поколения. Разрыв, который трудно объяснить косметическими улучшениями.
Про «скрытые рассуждения» — не путайте два разных явления
В обсуждениях эти вещи всё время смешивают, а они не связаны.
Первое: модель по-прежнему рассуждает текстом. Цепочка рассуждений у Astra есть.
Второе: OpenAI не показывает эту цепочку пользователю. Так делают с самых первых рассуждающих моделей, и к архитектуре это отношения не имеет — это продуктовое решение.
Петли сами по себе ничего не прячут. Если ответы стали короче, это чаще значит, что модель быстрее приходит к результату, а не что от вас что-то скрыли.
Что из этого следует на практике
Понимание архитектуры превращается в одно простое правило: глубина стоит времени и денег.
Модель, которая гоняет вход по кругу, физически не может ответить мгновенно и дёшево. За это вы получаете качество на сложных задачах: длинные цепочки рассуждений, нетривиальный код, трёхмерная графика, задачи, где нужно удержать много условий сразу.
На повседневных задачах эта глубина простаивает. Письмо, разбор документа, перевод, обычный код — здесь быстрая модель даст такой же результат, а разница в счёте будет кратной.
Именно поэтому в конструкторе сайтов tenzor тир кода выбираете вы, а не мы за вас: простой лендинг соберёт быстрая модель, а сложное приложение с трёхмерной сценой имеет смысл отдать Astra и заплатить за глубину.
Что такое зацикленный трансформер?+
Модель, которая прогоняет данные через одну и ту же стопку слоёв несколько раз вместо того, чтобы наращивать число разных слоёв. Глубина обработки растёт, число весов остаётся прежним.
Такая модель дешевле обычной?+
Дешевле по памяти на веса, но не по вычислениям: каждый повторный проход считается заново. На обучении выигрыш около 7–18% по данным исследования SMELT.
Правда ли GPT-6 Astra устроена именно так?+
OpenAI это не подтверждала. Есть только косвенный намёк: глубина вычислений у Astra отличается от GPT-4 не более чем вдвое при заметно более высоких результатах.
Почему не показывают рассуждения модели?+
Это решение разработчика, а не свойство архитектуры. Цепочка рассуждений у модели есть, просто её не выводят пользователю — так делают с первых рассуждающих моделей.
Что дальше почитать
- Модели для чата — что доступно сейчас и по какой цене.
- Токены и кредиты: как устроена оплата — почему счёт идёт за токены.
Соберите сайт в чате
Тир модели выбираете вы: простую страницу соберёт быстрая, сложное приложение — самая сильная.
Открыть чат