tenzorНачать
Все статьи

ИИ в науке: Claude сам довёл расчёт, который физики считали неподъёмным

Физик-теоретик Мэтт фон Хиппель предложил ИИ-лабораториям задачу из своей области: посчитать девятипетлевую амплитуду рассеяния в теории N=4 super Yang-Mills. Считалось, что такой расчёт на скромных академических ресурсах не поднять. Claude довёл его до конца двумя независимыми способами, потратив порядка одной-двух тысяч долларов. Результат проверил Ланс Диксон из SLAC.

Что за задача и почему её считали неподъёмной

N=4 super Yang-Mills — это не описание нашего мира, а учебный полигон. Физики используют её, чтобы отлаживать методы расчётов, которые потом переносят на настоящие теории. Устройство теории позволяет считать то, что в реальных моделях пока недоступно.

Амплитуда рассеяния описывает, с какой вероятностью частицы разлетятся тем или иным образом. Число петель означает порядок точности: каждая следующая петля увеличивает объём вычислений многократно. Девять петель — та граница, за которой ручная работа перестаёт помещаться в разумные сроки, а перебор вариантов упирается в вычислительный бюджет университетской лаборатории.

Что сделала модель

Claude решил задачу двумя разными путями: прямым методом угадывания структуры ответа с последующей проверкой и обходным, через связанные величины. Два независимых способа с одинаковым результатом — обычная для физики форма самопроверки.

Бюджет получился скромным по меркам лаборатории: около одной-двух тысяч долларов, причём один из подходов обошёлся примерно в сто. По вычислениям это эквивалент недели работы девяноста шести процессоров.

Результат подтвердил Ланс Диксон, профессор SLAC и один из тех, кто занимается такими расчётами профессионально. Без независимой проверки история была бы просто заявлением.

Главное здесь не физика

В марте похожие попытки выглядели иначе: модель работала как студент, которого нужно вести за руку и поправлять на каждом шаге. Теперь она провела фронтирный расчёт самостоятельно, без постоянного присмотра. За полгода изменилась не эрудиция, а способность держать длинную работу.

Почему это отличается от «нейросеть решила задачу по физике»

Запросы вида «реши задачу по физике» модель закрывала давно, и там всё понятно: задача имеет известный ответ, метод описан в учебнике, модель воспроизводит путь.

Здесь ответа не было ни у кого. Не было и готового рецепта: пришлось выбрать метод, написать вычислительный код, прогнать его, проверить результат вторым способом. Это ближе к работе аспиранта за несколько месяцев, чем к решению задачи из задачника.

Отсюда практический вывод, который сам фон Хиппель и делает: решаемых таким образом задач в науке больше, чем считалось. Не потому, что модель умнее физика, а потому что у неё хватает терпения на перебор, который человек не станет делать руками.

Где предел

Стоит держать в голове три ограничения.

Первое: задача была вычислительной. Понятна цель, есть критерий правильности, результат можно проверить. В областях, где нет однозначной проверки, такой подход работает намного хуже.

Второе: проверял человек, и без него результат ничего не стоил бы. Модель могла выдать правдоподобный ответ с ошибкой в середине, и заметить это способен только специалист.

Третье: теория выбрана специально удобной. N=4 super Yang-Mills на то и существует, чтобы в ней считалось лучше, чем в физике реального мира.

Что из этого переносится на обычную работу

Схема, которая сработала в физике, повторяется в любой задаче с проверяемым результатом.

  • Два независимых пути к ответу. Попросите модель прийти к результату другим способом и сравните. Расхождение указывает на ошибку точнее, чем любая проверка «на глаз».
  • Критерий правильности до начала работы. Если вы не можете заранее сказать, как отличить верный ответ от неверного, модель не поможет, а только ускорит движение в неверную сторону.
  • Расчёт и код вместо рассуждений. Там, где нужна арифметика или перебор, просите модель написать и выполнить код. Считать в голове она по-прежнему умеет плохо.
  • Финальная проверка за человеком. Она не отменяется ни на каком уровне модели.

Первые три вещи в tenzor делаются в обычном чате: модель пишет и выполняет код, работает с таблицами, показывает промежуточные шаги.

Что именно посчитал Claude?+

Девятипетлевую амплитуду рассеяния в теории N=4 super Yang-Mills — вспомогательной теории, на которой физики отлаживают методы вычислений. Расчёт такого порядка считался неподъёмным для скромных академических ресурсов.

Сколько это стоило?+

Порядка одной-двух тысяч долларов, при этом один из двух использованных методов обошёлся примерно в сто. По вычислительным ресурсам — эквивалент недели работы 96 процессоров.

Кто проверил результат?+

Ланс Диксон, профессор SLAC, который занимается такими расчётами профессионально. Задачу перед лабораториями поставил физик Мэтт фон Хиппель.

Может ли нейросеть решать научные задачи вообще?+

Хорошо получается там, где есть понятный критерий правильности и результат можно проверить вычислением. Там, где проверки нет, модель выдаёт правдоподобный текст, и отличить его от верного ответа способен только специалист.

Что дальше почитать

Проверьте ответ вторым способом

Попросите модель прийти к результату другим путём и сравните. На расчётах это самая дешёвая проверка.

Открыть чат