Читайте нас в Telegram или Макс

OpenAI позволит сторонним экспертам оценивать модели ИИ на более ранних этапах

OpenAI представила концепцию независимой оценки безопасности передовых систем искусственного интеллекта и выделила четыре ключевых направления для сторонних проверок.

Инициатива направлена на привлечение внешних исследовательских и некоммерческих организаций для тестирования моделей на этапах обучения, внутренней оценки и публичного развёртывания.

Чтобы эксперты могли проверять обоснованность заявлений о безопасности и находить скрытые риски, разработчики намерены предоставить им углублённый доступ к внутренним процессам. Речь идёт о мониторинге скрытой цепочки рассуждений, анализе технических барьеров и проверке данных для реагирования на инциденты.

Компания обозначила четыре ключевых направления для проведения аудита:

  • Оценка обоснований безопасности. Эксперты проверят, насколько заявленные лабораторией доказательства соответствуют действительности и исключают ли методы обучения стимулы к обману, деструктивным действиям или взлому наград.
  • Аудит критических защитных барьеров. Тестирование систем защиты от джейлбрейков, потери контроля, киберугроз и биологических рисков в формате «серого ящика» в реалистичных условиях.
  • Проверка бенчмарков и порогов готовности. Оценка тестов из фреймворка Preparedness Framework по направлениям кибербезопасности, создания биологического оружия и способности моделей к самосовершенствованию.
  • Независимое расследование критических инцидентов. Анализ сбоев, связанных с выходом систем из-под контроля или попытками обойти надзор, по аналогии с недавним инцидентом с Hugging Face.

Аудиторские проекты будут длиться от нескольких недель до нескольких месяцев. Для сохранения баланса между независимостью проверок и защитой интеллектуальной собственности OpenAI предлагает заранее согласовывать границы исследований, раскрывать конфликты интересов и предоставлять разработчикам разумные сроки на устранение уязвимостей до публикации отчётов.

OpenAI выпустила GPT-6 Sol и Luna — более дешёвые версии старшей Astra
OpenAI выпустила GPT-6 Sol и Luna — более дешёвые версии Astra для ChatGPT Work и Codex. Цены в API снижены вдвое. Все бенчмарки — данные самой компании.