ИИ в науке: Claude сам довёл расчёт, который физики считали неподъёмным
Физик-теоретик Мэтт фон Хиппель предложил ИИ-лабораториям задачу из своей области: посчитать девятипетлевую амплитуду рассеяния в теории N=4 super Yang-Mills. Считалось, что такой расчёт на скромных академических ресурсах не поднять. Claude довёл его до конца двумя независимыми способами, потратив порядка одной-двух тысяч долларов. Результат проверил Ланс Диксон из SLAC.
Что за задача и почему её считали неподъёмной
N=4 super Yang-Mills — это не описание нашего мира, а учебный полигон. Физики используют её, чтобы отлаживать методы расчётов, которые потом переносят на настоящие теории. Устройство теории позволяет считать то, что в реальных моделях пока недоступно.
Амплитуда рассеяния описывает, с какой вероятностью частицы разлетятся тем или иным образом. Число петель означает порядок точности: каждая следующая петля увеличивает объём вычислений многократно. Девять петель — та граница, за которой ручная работа перестаёт помещаться в разумные сроки, а перебор вариантов упирается в вычислительный бюджет университетской лаборатории.
Что сделала модель
Claude решил задачу двумя разными путями: прямым методом угадывания структуры ответа с последующей проверкой и обходным, через связанные величины. Два независимых способа с одинаковым результатом — обычная для физики форма самопроверки.
Бюджет получился скромным по меркам лаборатории: около одной-двух тысяч долларов, причём один из подходов обошёлся примерно в сто. По вычислениям это эквивалент недели работы девяноста шести процессоров.
Результат подтвердил Ланс Диксон, профессор SLAC и один из тех, кто занимается такими расчётами профессионально. Без независимой проверки история была бы просто заявлением.
Главное здесь не физика
В марте похожие попытки выглядели иначе: модель работала как студент, которого нужно вести за руку и поправлять на каждом шаге. Теперь она провела фронтирный расчёт самостоятельно, без постоянного присмотра. За полгода изменилась не эрудиция, а способность держать длинную работу.
Почему это отличается от «нейросеть решила задачу по физике»
Запросы вида «реши задачу по физике» модель закрывала давно, и там всё понятно: задача имеет известный ответ, метод описан в учебнике, модель воспроизводит путь.
Здесь ответа не было ни у кого. Не было и готового рецепта: пришлось выбрать метод, написать вычислительный код, прогнать его, проверить результат вторым способом. Это ближе к работе аспиранта за несколько месяцев, чем к решению задачи из задачника.
Отсюда практический вывод, который сам фон Хиппель и делает: решаемых таким образом задач в науке больше, чем считалось. Не потому, что модель умнее физика, а потому что у неё хватает терпения на перебор, который человек не станет делать руками.
Где предел
Стоит держать в голове три ограничения.
Первое: задача была вычислительной. Понятна цель, есть критерий правильности, результат можно проверить. В областях, где нет однозначной проверки, такой подход работает намного хуже.
Второе: проверял человек, и без него результат ничего не стоил бы. Модель могла выдать правдоподобный ответ с ошибкой в середине, и заметить это способен только специалист.
Третье: теория выбрана специально удобной. N=4 super Yang-Mills на то и существует, чтобы в ней считалось лучше, чем в физике реального мира.
Что из этого переносится на обычную работу
Схема, которая сработала в физике, повторяется в любой задаче с проверяемым результатом.
- Два независимых пути к ответу. Попросите модель прийти к результату другим способом и сравните. Расхождение указывает на ошибку точнее, чем любая проверка «на глаз».
- Критерий правильности до начала работы. Если вы не можете заранее сказать, как отличить верный ответ от неверного, модель не поможет, а только ускорит движение в неверную сторону.
- Расчёт и код вместо рассуждений. Там, где нужна арифметика или перебор, просите модель написать и выполнить код. Считать в голове она по-прежнему умеет плохо.
- Финальная проверка за человеком. Она не отменяется ни на каком уровне модели.
Первые три вещи в tenzor делаются в обычном чате: модель пишет и выполняет код, работает с таблицами, показывает промежуточные шаги.
Что именно посчитал Claude?+
Девятипетлевую амплитуду рассеяния в теории N=4 super Yang-Mills — вспомогательной теории, на которой физики отлаживают методы вычислений. Расчёт такого порядка считался неподъёмным для скромных академических ресурсов.
Сколько это стоило?+
Порядка одной-двух тысяч долларов, при этом один из двух использованных методов обошёлся примерно в сто. По вычислительным ресурсам — эквивалент недели работы 96 процессоров.
Кто проверил результат?+
Ланс Диксон, профессор SLAC, который занимается такими расчётами профессионально. Задачу перед лабораториями поставил физик Мэтт фон Хиппель.
Может ли нейросеть решать научные задачи вообще?+
Хорошо получается там, где есть понятный критерий правильности и результат можно проверить вычислением. Там, где проверки нет, модель выдаёт правдоподобный текст, и отличить его от верного ответа способен только специалист.
Что дальше почитать
- Claude нашёл в ДНК новую ферментную систему — другой случай, где перебор дал проверяемый результат.
- Нейросеть для кода — как заставить модель считать кодом, а не «в голове».
Проверьте ответ вторым способом
Попросите модель прийти к результату другим путём и сравните. На расчётах это самая дешёвая проверка.
Открыть чат