Anthropic выпустила Claude Opus 5 — новый флагман по цене предыдущей модели

Кодик кратко объясняет суть статьи
Anthropic представила Claude Opus 5 — новую флагманскую модель, которая по уровню интеллекта приближается к топовой Claude Fable 5, но стоит вдвое дешевле. Модель установила рекорды компании в бенчмарках по программированию и работе со знаниями (Frontier-Bench, GDPval-AA), более чем вдвое превзойдя Opus 4.8, а на CursorBench показала результат почти на уровне Fable 5. На тесте ARC-AGI 3 Opus 5 превосходит ближайшего конкурента втрое, на Zapier AutomationBench справляется с задачами в полтора раза чаще аналогов, а в OSWorld 2.0 достигает лучших результатов за треть стоимости Fable 5. Модель также улучшила показатели в науках, включая биологию и химию. Opus 5 стала самой «выровненной» в плане безопасности: реже лжёт, устойчивее к манипуляциям и менее склонна к рискованным действиям. При этом, несмотря на прогресс в поиске уязвимостей, модель намеренно не обучалась созданию эксплойтов и уступает Mythos 5 в кибератаках. Стоимость осталась прежней — $5 за миллион входных и $25 за выходных токенов, доступен ускоренный режим за двойную цену.
Читайте в Telegram
|
Anthropic представила Claude Opus 5 — новую флагманскую модель, которая приближается по уровню интеллекта к топовой Claude Fable 5, но стоит вдвое дешевле, сообщается в блоге компании.
По данным Anthropic, на бенчмарках по программированию и работе со знаниями — Frontier-Bench и GDPval-AA — Opus 5 стала новым эталоном среди моделей компании, хотя всё ещё уступает Mythos 5 в задачах по кибербезопасности.
- На тесте Frontier-Bench v0.1 модель более чем вдвое превзошла показатели Opus 4.8 при меньшей стоимости выполнения задачи, а на CursorBench при максимальном уровне усилий показала результат в пределах 0,5% от пикового результата Fable 5 — но по цене вдвое ниже.
- В решении новых, нестандартных задач на тесте ARC-AGI 3 модель показала результат втрое выше ближайшего конкурента. На бенчмарке автоматизации бизнес-процессов Zapier AutomationBench модель проходит задачи примерно в полтора раза чаще конкурентов при той же стоимости, а на тесте по управлению компьютером OSWorld 2.0 обходит все модели по любому уровню затрат, превзойдя лучший результат Fable 5 примерно за треть её стоимости.

- Заметный прогресс отмечен и в научных задачах: модель показала более высокие результаты, чем Opus 4.8, по всем оценкам в области естественных наук, включая структурную биологию и органическую химию.
Anthropic также сообщила, что по итогам автоматизированного аудита поведения Opus 5 стала самой «выровненной» моделью компании: она реже других врёт, устойчивее к попыткам склонить её к вредоносному использованию и реже совершает рискованные необратимые действия.
Отдельно компания подчеркнула ограничения безопасности: несмотря на рост возможностей в кибербезопасности за счёт общего повышения интеллекта модели, Opus 5 намеренно не обучали кибератакам, и по способности превращать найденные уязвимости в реальные эксплойты она значительно отстаёт от Mythos 5 — хотя в самом поиске уязвимостей результаты уже близки.
Стоимость осталась на уровне предыдущей версии — $5 за миллион входных токенов и $25 за миллион выходных. Модель также доступна в ускоренном Fast-режиме — примерно в 2,5 раза быстрее обычного, по двойной цене.
Напомним, «Код Дурова» уже писал о выходе предыдущей флагманской модели — в Claude Opus 4.8 Anthropic сделала упор на «честность» модели. Подробнее:






