Кодик кратко объясняет суть статьи
Исследователи проекта DrivingBench провели эксперимент по управлению реальным автомобилем — Toyota Corolla 2022 — с помощью флагманских языковых моделей. Управление осуществлялось через устройство Comma Four и систему Openpilot, подключённую к CAN-шине машины. Данные с камер и телеметрия передавались на ноутбук через локальный MCP-сервер, откуда поступали в чат с ИИ. Модели могли использовать три инструмента: просмотр видео, выдачу команд рулевому управлению и экстренное торможение. Тесты проходили на закрытой парковке при скорости до 13 км/ч, с оператором, готовым вмешаться. Маршрут длиной 130 метров включал повороты и зону парковки. Каждая модель имела до трёх попыток с анализом ошибок после неудач. Единственной успешной оказалась GPT-6 Astra, преодолевшая трассу со второй попытки за пять минут. Остальные результаты: Claude Fable 5.1 — 45%, Grok 4.6 — 11%, GPT-5.6 Sol — 6%. Основные ошибки связаны с восприятием пространства, оценкой габаритов и задержками в командах. Эксперимент показал, что современные ИИ способны управлять автомобилем в простых условиях, но требуют улучшения в скорости реакции и пространственном планировании. Также Anthropic представила новую флагманскую модель Claude Opus 5.5, которая превосходит GPT-6 Astra в программировании, работает на 30% быстрее и имеет более низкую стоимость.
Читайте в Telegram
|
Авторы проекта DrivingBench опубликовали подробный отчёт об эксперименте, в рамках которого проверили способность флагманских языковых моделей управлять реальным автомобилем.
Цель исследования состояла в том, чтобы протестировать поведение универсальных ИИ-агентов в условиях реального мира с естественными задержками восприятия и отклика. Для эксперимента использовали седан Toyota Corolla 2022 года выпуска. Управление машиной осуществлялось через устройство Comma Four под управлением открытой системы Openpilot, подключённое напрямую к CAN-шине автомобиля.
Архитектура системы строилась вокруг ноутбука, подключённого к мобильной точке доступа: телеметрия и кадры с двух дорожных камер передавались через локальный MCP-сервер в чат с моделью. ИИ-агенты могли вызывать три инструмента: наблюдать за обстановкой через камеры, задавать движение (угол поворота руля, скорость и длительность команды) или экстренно тормозить.
Для обеспечения безопасности испытания проводили на изолированной парковке, а скорость движения программно ограничили диапазоном от 0,5 до 3,5 м/с (до 13 км/ч). При этом на водительском месте непрерывно находился оператор, державший ногу над педалью тормоза.
Маршрут длиной около 130 метров разметили конусами. Он включал прямые отрезки, левые и правые повороты, а также финишную зону парковки. Каждой модели предоставили до трёх попыток в рамках одного диалога, сопровождая неудачи запросом на анализ допущенных ошибок для оценки способности к обучению в контексте.

Единственной моделью, которая смогла полностью пройти дистанцию, стала GPT-6 Astra — со второй попытки она преодолела трассу примерно за пять минут. В первой попытке Astra успешно проехала половину пути.
Результаты остальных участников оказались значительно скромнее:
- Claude Fable 5.1 в лучшей из трёх попыток преодолела 45% маршрута;
- Grok 4.6 доехал до отметки в 11%;
- GPT-5.6 Sol смогла пройти лишь 6% дистанции.
Большинство сходов было вызвано ошибками восприятия: модели путали стороны конусной разметки, неверно оценивали габариты автомобиля по камерам или делали слишком длинные паузы между подачей управляющих команд.
По словам создателей бенчмарка, эксперимент доказал принципиальную возможность современных нейросетей ориентироваться в физическом пространстве на малых скоростях, однако для более стабильной работы требуется дальнейшее снижение задержек и развитие навыков пространственного планирования.







