23 сентября 2026

btc = 86 921.00$ 1 576.41 (1.85 %)

usd = 84.07 -0.03 (-0.04 %)

eur = 96.59 0.22 (0.23 %)

cny = 12.53 -0.02 (-0.13 %)

moex = 2 311.68 пт. 11.59 (0.50 %)

btc = 86 921.00$ 1 576.41 (1.85 %)

usd = 84.07 -0.03 (-0.04 %)

OpenAI позволит сторонним экспертам оценивать модели ИИ на более ранних этапах

1 минута на чтение
OpenAI позволит сторонним экспертам оценивать модели ИИ на более ранних этапах

Кодик кратко объясняет суть статьи

OpenAI представила концепцию независимой оценки безопасности передовых ИИ-систем, выделив четыре направления для аудита: проверку обоснований безопасности, критических защитных барьеров, бенчмарков готовности и расследование критических инцидентов. Компания планирует привлекать внешние организации, предоставляя им доступ к внутренним процессам моделей на разных этапах разработки. Аудиты будут проводиться в формате «серого ящика» с соблюдением баланса между независимостью и защитой интеллектуальной собственности. Также OpenAI анонсировала запуск более дешёвых версий GPT-6 — Sol и Luna — для ChatGPT Work и Codex, сократив цены в API вдвое. Все заявленные результаты основаны на внутренних данных компании.

Читайте в Telegram

|

OpenAI представила концепцию независимой оценки безопасности передовых систем искусственного интеллекта и выделила четыре ключевых направления для сторонних проверок.

Инициатива направлена на привлечение внешних исследовательских и некоммерческих организаций для тестирования моделей на этапах обучения, внутренней оценки и публичного развёртывания.

Чтобы эксперты могли проверять обоснованность заявлений о безопасности и находить скрытые риски, разработчики намерены предоставить им углублённый доступ к внутренним процессам. Речь идёт о мониторинге скрытой цепочки рассуждений, анализе технических барьеров и проверке данных для реагирования на инциденты.

Компания обозначила четыре ключевых направления для проведения аудита:

  • Оценка обоснований безопасности. Эксперты проверят, насколько заявленные лабораторией доказательства соответствуют действительности и исключают ли методы обучения стимулы к обману, деструктивным действиям или взлому наград.
  • Аудит критических защитных барьеров. Тестирование систем защиты от джейлбрейков, потери контроля, киберугроз и биологических рисков в формате «серого ящика» в реалистичных условиях.
  • Проверка бенчмарков и порогов готовности. Оценка тестов из фреймворка Preparedness Framework по направлениям кибербезопасности, создания биологического оружия и способности моделей к самосовершенствованию.
  • Независимое расследование критических инцидентов. Анализ сбоев, связанных с выходом систем из-под контроля или попытками обойти надзор, по аналогии с недавним инцидентом с Hugging Face.

Аудиторские проекты будут длиться от нескольких недель до нескольких месяцев. Для сохранения баланса между независимостью проверок и защитой интеллектуальной собственности OpenAI предлагает заранее согласовывать границы исследований, раскрывать конфликты интересов и предоставлять разработчикам разумные сроки на устранение уязвимостей до публикации отчётов.

OpenAI выпустила GPT-6 Sol и Luna — более дешёвые версии старшей Astra
OpenAI выпустила GPT-6 Sol и Luna — более дешёвые версии Astra для ChatGPT Work и Codex. Цены в API снижены вдвое. Все бенчмарки — данные самой компании.
Теги:
Обсудить
Блоги 961
Softline
StudyAI
SpeShu.AI
OTP Bank
билайн
Слетать.ру
Т-Банк
VK
ВТБ
Газпромбанк

Кодик

Привет!

Я — Кодик, твой персональный ИИ-агент для поиска информации по «Код.ру» на базе Yandex AI Studio. Я могу быстро найти на сайте нужную тему, порекомендовать похожие материалы или объяснить сложный термин — и в целом поделиться знаниями о науке и технологиях. Задай вопрос или начни с одного из предложенных вариантов.