Читайте нас в Telegram или Макс

ИИ посадили за руль реального автомобиля: что вышло

Авторы проекта DrivingBench опубликовали подробный отчёт об эксперименте, в рамках которого проверили способность флагманских языковых моделей управлять реальным автомобилем.

Цель исследования состояла в том, чтобы протестировать поведение универсальных ИИ-агентов в условиях реального мира с естественными задержками восприятия и отклика. Для эксперимента использовали седан Toyota Corolla 2022 года выпуска. Управление машиной осуществлялось через устройство Comma Four под управлением открытой системы Openpilot, подключённое напрямую к CAN-шине автомобиля.

Архитектура системы строилась вокруг ноутбука, подключённого к мобильной точке доступа: телеметрия и кадры с двух дорожных камер передавались через локальный MCP-сервер в чат с моделью. ИИ-агенты могли вызывать три инструмента: наблюдать за обстановкой через камеры, задавать движение (угол поворота руля, скорость и длительность команды) или экстренно тормозить.

Для обеспечения безопасности испытания проводили на изолированной парковке, а скорость движения программно ограничили диапазоном от 0,5 до 3,5 м/с (до 13 км/ч). При этом на водительском месте непрерывно находился оператор, державший ногу над педалью тормоза.

Маршрут длиной около 130 метров разметили конусами. Он включал прямые отрезки, левые и правые повороты, а также финишную зону парковки. Каждой модели предоставили до трёх попыток в рамках одного диалога, сопровождая неудачи запросом на анализ допущенных ошибок для оценки способности к обучению в контексте.

Источник: DrivingBench

Единственной моделью, которая смогла полностью пройти дистанцию, стала GPT-6 Astra — со второй попытки она преодолела трассу примерно за пять минут. В первой попытке Astra успешно проехала половину пути.

Результаты остальных участников оказались значительно скромнее:

  • Claude Fable 5.1 в лучшей из трёх попыток преодолела 45% маршрута;
  • Grok 4.6 доехал до отметки в 11%;
  • GPT-5.6 Sol смогла пройти лишь 6% дистанции.

Большинство сходов было вызвано ошибками восприятия: модели путали стороны конусной разметки, неверно оценивали габариты автомобиля по камерам или делали слишком длинные паузы между подачей управляющих команд.

По словам создателей бенчмарка, эксперимент доказал принципиальную возможность современных нейросетей ориентироваться в физическом пространстве на малых скоростях, однако для более стабильной работы требуется дальнейшее снижение задержек и развитие навыков пространственного планирования.

Anthropic выпустила Claude Opus 5.5: что умеет новая модель
Anthropic представила флагманскую нейросеть Claude Opus 5.5. Она превосходит GPT-6 Astra в кодинге, работает на 30% быстрее и стоит дешевле.