tenzorНачать
Все статьи

Как устроена GPT-6 Astra: зацикленные трансформеры простыми словами

Себастьян Рашка разобрал, как может быть устроена GPT-6 Astra, и текст за сутки стал самым читаемым техническим материалом на Hacker News. Тема звучит страшно — «зацикленные трансформеры», «скрытые рассуждения». На деле идея простая, и понимать её полезно: от неё напрямую зависит, почему одни модели отвечают за секунду и стоят копейки, а другие думают минуту и стоят в двадцать раз дороже.

GPT-6 Astra и зацикленные трансформеры: схема повторного прохода по одним и тем же слоям

Как работает обычная модель

Языковая модель — это стопка одинаковых по устройству слоёв. Текст заходит снизу, проходит слой за слоем вверх, и на выходе получается следующий кусочек ответа. Чем больше слоёв, тем «глубже» модель может обдумать вход, и тем больше в ней весов, которые надо хранить и обучать.

Отсюда простое правило последних лет: хочешь модель умнее — делай стопку выше. Проблема в том, что каждый новый слой добавляет памяти и денег.

Что меняет петля

Зацикленный трансформер вместо новых слоёв прогоняет вход через одну и ту же стопку несколько раз. Один из примеров в разборе: 22 блока применяются дважды, и получается глубина в 44 прохода при памяти на 22 блока.

Аналогия близкая к жизни: вы не нанимаете второго бухгалтера, а просите того же самого пройти отчёт ещё раз, свежим взглядом. Людей в штате столько же, работы сделано вдвое больше — и времени ушло вдвое больше.

Петля вместо новых слоёв: одна стопка блоков применяется дважды, глубина растёт, вес модели остаётся прежним

Экономия здесь только на весах. Вычислений столько же, сколько у высокой стопки, а на обучении разница небольшая: в исследовании SMELT зацикленные варианты требовали на 7–18% меньше вычислений при том же качестве.

Что известно про саму Astra

Прямо OpenAI ничего не подтверждала. Главная зацепка — фраза их научного руководителя: глубина вычислительного графа у нынешних флагманов, включая Astra, отличается от GPT-4 не больше чем вдвое. При том что модель заметно сильнее, это косвенно намекает на петли: глубина работы выросла не за счёт роста стопки.

Что известно по результатам: Astra особенно хороша в трёхмерной графике и берёт 99,9% на бенчмарке ARC-AGI-3 против 7,8% у предыдущего поколения. Разрыв, который трудно объяснить косметическими улучшениями.

Про «скрытые рассуждения» — не путайте два разных явления

В обсуждениях эти вещи всё время смешивают, а они не связаны.

Первое: модель по-прежнему рассуждает текстом. Цепочка рассуждений у Astra есть.

Второе: OpenAI не показывает эту цепочку пользователю. Так делают с самых первых рассуждающих моделей, и к архитектуре это отношения не имеет — это продуктовое решение.

Петли сами по себе ничего не прячут. Если ответы стали короче, это чаще значит, что модель быстрее приходит к результату, а не что от вас что-то скрыли.

Что из этого следует на практике

Понимание архитектуры превращается в одно простое правило: глубина стоит времени и денег.

Модель, которая гоняет вход по кругу, физически не может ответить мгновенно и дёшево. За это вы получаете качество на сложных задачах: длинные цепочки рассуждений, нетривиальный код, трёхмерная графика, задачи, где нужно удержать много условий сразу.

На повседневных задачах эта глубина простаивает. Письмо, разбор документа, перевод, обычный код — здесь быстрая модель даст такой же результат, а разница в счёте будет кратной.

Именно поэтому в конструкторе сайтов tenzor тир кода выбираете вы, а не мы за вас: простой лендинг соберёт быстрая модель, а сложное приложение с трёхмерной сценой имеет смысл отдать Astra и заплатить за глубину.

Когда платить за глубину: простые задачи — быстрая модель, сложные — Astra
Что такое зацикленный трансформер?+

Модель, которая прогоняет данные через одну и ту же стопку слоёв несколько раз вместо того, чтобы наращивать число разных слоёв. Глубина обработки растёт, число весов остаётся прежним.

Такая модель дешевле обычной?+

Дешевле по памяти на веса, но не по вычислениям: каждый повторный проход считается заново. На обучении выигрыш около 7–18% по данным исследования SMELT.

Правда ли GPT-6 Astra устроена именно так?+

OpenAI это не подтверждала. Есть только косвенный намёк: глубина вычислений у Astra отличается от GPT-4 не более чем вдвое при заметно более высоких результатах.

Почему не показывают рассуждения модели?+

Это решение разработчика, а не свойство архитектуры. Цепочка рассуждений у модели есть, просто её не выводят пользователю — так делают с первых рассуждающих моделей.

Что дальше почитать

Соберите сайт в чате

Тир модели выбираете вы: простую страницу соберёт быстрая, сложное приложение — самая сильная.

Открыть чат