OpenAI позволит сторонним экспертам оценивать модели ИИ на более ранних этапах

OpenAI представила концепцию независимой оценки безопасности передовых систем искусственного интеллекта и выделила четыре ключевых направления для сторонних проверок.
Инициатива направлена на привлечение внешних исследовательских и некоммерческих организаций для тестирования моделей на этапах обучения, внутренней оценки и публичного развёртывания.
Чтобы эксперты могли проверять обоснованность заявлений о безопасности и находить скрытые риски, разработчики намерены предоставить им углублённый доступ к внутренним процессам. Речь идёт о мониторинге скрытой цепочки рассуждений, анализе технических барьеров и проверке данных для реагирования на инциденты.
Компания обозначила четыре ключевых направления для проведения аудита:
- Оценка обоснований безопасности. Эксперты проверят, насколько заявленные лабораторией доказательства соответствуют действительности и исключают ли методы обучения стимулы к обману, деструктивным действиям или взлому наград.
- Аудит критических защитных барьеров. Тестирование систем защиты от джейлбрейков, потери контроля, киберугроз и биологических рисков в формате «серого ящика» в реалистичных условиях.
- Проверка бенчмарков и порогов готовности. Оценка тестов из фреймворка Preparedness Framework по направлениям кибербезопасности, создания биологического оружия и способности моделей к самосовершенствованию.
- Независимое расследование критических инцидентов. Анализ сбоев, связанных с выходом систем из-под контроля или попытками обойти надзор, по аналогии с недавним инцидентом с Hugging Face.
Аудиторские проекты будут длиться от нескольких недель до нескольких месяцев. Для сохранения баланса между независимостью проверок и защитой интеллектуальной собственности OpenAI предлагает заранее согласовывать границы исследований, раскрывать конфликты интересов и предоставлять разработчикам разумные сроки на устранение уязвимостей до публикации отчётов.