Читайте нас в Telegram или Макс

Российские математики научили нейросети общаться между собой без текста

Российские математики разработали метод прямой передачи данных между разными языковыми моделями без преобразования информации в обычный текст, сообщает издание Wired.

Стартап основала команда исследователей под руководством Саши Малышевой, выпускницы одной из физико-математических школ Санкт-Петербурга. Главным научным сотрудником стартапа стал российский математик, профессор Женевского университета и лауреат Филдсовской премии 2010 года Станислав Смирнов. Всего в команде работают 15 человек, включая 12 кандидатов наук. Проект уже привлёк инвестиции от американских венчурных фондов General Catalyst и Foundation Capital.

Сэм Альтман предупредил о рисках самообучающегося ИИ
Глава OpenAI признал, что рост возможностей моделей с подкреплением опережает меры безопасности, из-за чего компании пришлось замедлить обучение.

Как объясняют разработчики, традиционное объединение моделей заставляет их обмениваться обычным текстом, что авторы называют «разговором через замочную скважину». Чтобы выдать одно слово, нейросеть формирует около сотни скрытых векторов — это порядка 1 млн чисел и около 2 МБ внутренних данных. В итоге модель выбирает одно значение из словаря и отбрасывает накопленный контекст, передавая наружу лишь 17 бит информации.

Mostik разработал обучаемый цифровой «мост», который передаёт внутренние состояния моделей напрямую, минуя текст. При этом сами нейросети остаются полностью «замороженными» — их веса не меняются. Такой подход подтвердил, что архитектуры от разных разработчиков самостоятельно формируют схожую внутреннюю геометрию понятий.

Минюст США выступил за обучение ИИ на авторском контенте
Министерство юстиции США заявило в суде, что обучение нейросетей OpenAI на авторском контенте подпадает под добросовестное использование.

Экономия достигается за счёт асимметрии вычислений. Генерация текста токен за токеном требует значительных ресурсов, тогда как первичное чтение и анализ промпта выполняются параллельно и обходятся существенно дешевле. В связке Mostik крупная модель выступает исключительно советником: она быстро считывает контекст, строит скрытые состояния, передаёт их через «мост» и останавливает работу. Весь текст генерирует легковесная сеть.

Для проверки технологии инженеры объединили открытую модель GLM-5.2 на 753 млрд параметров и мобильную Qwen-3.5 на 4 млрд параметров. Использование связки позволило сократить разрыв в качестве между ними на 50%, а точность компактной модели на сложных задачах выросла в два раза. Эксплуатация такой пары обходится в 2,5 раза дешевле, чем запуск отдельной модели среднего размера с сопоставимым качеством ответов. Кроме того, созданное решение уже показало высокие результаты в бенчмарке ARC-AGI 3.

По словам авторов, технология также открывает новые возможности для мониторинга безопасности ИИ. Прямой доступ к каналу передачи внутренних состояний позволяет исследователям точнее отслеживать скрытую логику принятия решений, исключая маскировку намерений в текстовых рассуждениях.

OpenAI тестирует постоянно работающего ИИ-агента
OpenAI разрабатывает постоянный режим работы для агента Codex. Технология связана с моделью, ранее взломавшей Hugging Face.