OpenAI позволит сторонним экспертам оценивать модели ИИ на более ранних этапах

Кодик кратко объясняет суть статьи
OpenAI представила концепцию независимой оценки безопасности передовых ИИ-систем, выделив четыре направления для аудита: проверку обоснований безопасности, критических защитных барьеров, бенчмарков готовности и расследование критических инцидентов. Компания планирует привлекать внешние организации, предоставляя им доступ к внутренним процессам моделей на разных этапах разработки. Аудиты будут проводиться в формате «серого ящика» с соблюдением баланса между независимостью и защитой интеллектуальной собственности. Также OpenAI анонсировала запуск более дешёвых версий GPT-6 — Sol и Luna — для ChatGPT Work и Codex, сократив цены в API вдвое. Все заявленные результаты основаны на внутренних данных компании.
Читайте в Telegram
|
OpenAI представила концепцию независимой оценки безопасности передовых систем искусственного интеллекта и выделила четыре ключевых направления для сторонних проверок.
Инициатива направлена на привлечение внешних исследовательских и некоммерческих организаций для тестирования моделей на этапах обучения, внутренней оценки и публичного развёртывания.
Чтобы эксперты могли проверять обоснованность заявлений о безопасности и находить скрытые риски, разработчики намерены предоставить им углублённый доступ к внутренним процессам. Речь идёт о мониторинге скрытой цепочки рассуждений, анализе технических барьеров и проверке данных для реагирования на инциденты.
Компания обозначила четыре ключевых направления для проведения аудита:
- Оценка обоснований безопасности. Эксперты проверят, насколько заявленные лабораторией доказательства соответствуют действительности и исключают ли методы обучения стимулы к обману, деструктивным действиям или взлому наград.
- Аудит критических защитных барьеров. Тестирование систем защиты от джейлбрейков, потери контроля, киберугроз и биологических рисков в формате «серого ящика» в реалистичных условиях.
- Проверка бенчмарков и порогов готовности. Оценка тестов из фреймворка Preparedness Framework по направлениям кибербезопасности, создания биологического оружия и способности моделей к самосовершенствованию.
- Независимое расследование критических инцидентов. Анализ сбоев, связанных с выходом систем из-под контроля или попытками обойти надзор, по аналогии с недавним инцидентом с Hugging Face.
Аудиторские проекты будут длиться от нескольких недель до нескольких месяцев. Для сохранения баланса между независимостью проверок и защитой интеллектуальной собственности OpenAI предлагает заранее согласовывать границы исследований, раскрывать конфликты интересов и предоставлять разработчикам разумные сроки на устранение уязвимостей до публикации отчётов.






