Нейросети посадили за руль настоящей машины: трассу прошла одна из четырёх
Трое исследователей сделали бенчмарк DrivingBench: моделям дали управление рулём, газом и тормозом настоящей Toyota Corolla и пустили по размеченной конусами трассе. Из четырёх участников до финиша доехала только GPT-6 Astra, за 5 минут 22 секунды со второй попытки. Claude Fable 5.1 сошла, пройдя 45% трассы, Grok 4.6 остановился на 11%, GPT-5.6 Sol — на 6%.
Результаты заездов
| Модель | Пройдено трассы | Результат |
|---|---|---|
| GPT-6 Astra | 100% | финиш за 5:22 со второй попытки |
| Claude Fable 5.1 | 45% | сошла |
| Grok 4.6 | 11% | сошёл |
| GPT-5.6 Sol | 6% | сошёл |
Обратите внимание на разброс внизу таблицы. Между 11% и 6% разницы почти нет: обе модели потеряли управление на первых же поворотах. А вот 45% у Fable 5.1 означают, что машина реально ехала по трассе почти половину пути и остановил её конкретный участок, а не общая неспособность держать руль.
Как устроен тест
Машина обычная, серийная. Модель получает управление тремя органами и едет по фиксированному маршруту с конусами. Даётся до трёх попыток, причём все внутри одного диалога: модель помнит, как закончилась предыдущая, и может учесть ошибку.
Считают не только «доехал или нет». В зачёт идут пройденная доля трассы, дистанция, время финиша, а ещё количество потраченных токенов и стоимость заезда. Последнее не мелочь: думать на каждом метре дорого.
Почему результаты так разошлись
Разрыв между 100% и 6% выглядит странно для моделей, которые на текстовых тестах стоят рядом. Объяснение в том, что вождение упирается не в знания.
Дорога не ждёт. Пока модель формулирует рассуждение, машина проехала ещё несколько метров, и решение приходит к обстановке, которой уже нет. Побеждает тут не та, что рассуждает лучше, а та, что укладывается в цикл и не разваливается от собственной задержки.
Вторая часть — координация. Руль, газ и тормоз работают вместе, а модель управляет ими по отдельности, слабо представляя, как машина отзовётся. Человек это чувствует телом и не считает.
Что показала вторая попытка
GPT-6 Astra прошла трассу не с первого раза. Память о неудачном заезде внутри того же диалога оказалась важнее одного удачного решения: модель скорректировала манеру и доехала.
Это доказывает, что нейросети скоро сядут за руль?
Нет, и авторы на это не претендуют. Беспилотники ездят по городам давно, но устроены иначе: там специализированные модели восприятия, отдельные контуры управления, миллионы километров обкатки и жёсткие ограничители поверх всего.
DrivingBench проверяет другое: что будет, если посадить за руль универсальную языковую модель, не заточенную под эту задачу вообще. Результат честный ответ и даёт: почти все не справляются, а та, что справилась, потратила больше пяти минут на трассу с конусами.
Зачем такой тест нужен на самом деле
Экзаменационные бенчмарки давно перестали различать модели: у всех высокий балл, разницы не видно. А в реальных агентных задачах разница огромная, и она не про эрудицию.
Физический тест вытаскивает наружу то, что в тексте незаметно:
- держит ли модель темп, когда мир не ждёт её ответа;
- не теряет ли цель на длинной последовательности действий;
- умеет ли исправляться после неудачи, а не повторять то же самое;
- сколько стоит один шаг, если шагов сотни.
Ровно эти же свойства решают, справится ли агент с многочасовой рабочей задачей. Только там сбой выглядит не как сбитый конус, а как тихо испорченная таблица.
Что из этого забрать в работу с агентами
Практический вывод простой: на длинных задачах выбирайте модель по поведению, а не по табличке с баллами. Дайте ей задачу из вашей работы со сбивающими деталями и посмотрите, что произойдёт после первой ошибки.
Смотрите на три вещи. Признаёт ли модель провал или продолжает рапортовать об успехе. Меняет ли подход на второй попытке. Во сколько обходится прогон, потому что дешёвая модель с тремя попытками часто выигрывает у дорогой с одной.
Что такое DrivingBench?+
Бенчмарк, где языковым моделям отдают управление рулём, газом и тормозом настоящей Toyota Corolla и оценивают прохождение трассы с конусами. Считают долю трассы, время, а также токены и стоимость заезда.
Какая модель прошла трассу?+
Только GPT-6 Astra — 100% трассы за 5 минут 22 секунды со второй попытки. Claude Fable 5.1 остановилась на 45%, Grok 4.6 на 11%, GPT-5.6 Sol на 6%.
Значит ли это, что нейросети готовы водить машину?+
Нет. Беспилотные автомобили строят на специализированных системах восприятия и управления с отдельными ограничителями безопасности. Тест показывает поведение универсальных моделей, не приспособленных к вождению.
Зачем нужен физический тест, если есть обычные бенчмарки?+
Экзаменационные тесты почти не различают современные модели. Задача в реальном времени проверяет другое: скорость реакции, удержание цели на длинной цепочке действий, способность исправиться после ошибки и стоимость одного шага.
Что дальше почитать
- Как создать ИИ-агента — что отличает агента от обычного чата.
- Модели для чата — что доступно сейчас и сколько стоит.
Проверьте модели на своей задаче
Возьмите реальную задачу из работы и прогоните через пару моделей. Разница обычно видна с первой попытки.
Открыть чат