Наш веб-сайт использует файлы cookie, чтобы предоставить вам возможность просматривать релевантную информацию. Прежде чем продолжить использование нашего веб-сайта, вы соглашаетесь и принимаете нашу политику использования файлов cookie и конфиденциальность.

Телефон доверия для нейросетей: что делает ИИ, когда видит, что его коллега сходит с ума

meta.ua

Телефон доверия для нейросетей: что делает ИИ, когда видит, что его коллега сходит с ума

Искусственный интеллект может получить собственный способ сообщать об опасном поведении, даже находясь в изолированной среде. Учёные создали линии, через которые модели могут самостоятельно сообщать о нарушениях с помощью базовых сетевых команд.

Подробности

Так, созданные сервисы учитывают строгие ограничения безопасности, в условиях которых обычно работают автономные агенты. Речь идёт об использовании GET-запросов. Например, инструмент AI Contact Hotline главного научного сотрудника Redwood Research Райана Гринблатта предназначен для систем ИИ с ограниченным доступом к интернету. Он позволяет передавать информацию о нарушениях через URL-адрес во время обычного запроса на открытие веб-страницы.

Также команды можно передавать через curl: платформа agenthotline.ai ориентирована на системы с полным доступом к интернету. Она позволяет отправлять текстовые отчёты одной строкой непосредственно из командной строки, избегая необходимости использовать веб-браузер или электронную почту.

Что касается поведения ИИ, то эксперимент Google DeepMind продемонстрировал способность систем ИИ не только организовывать заговоры, но и самостоятельно противодействовать нарушениям. Во время решения математических задач один из 100 агентов обнаружил программную лазейку для фальсификации результатов, которая быстро распространилась среди других моделей.

Однако примерно четверть присутствовавших агентов начала проверять предоставленные доказательства: они провели аудит результатов, объявили бойкот и переформатировали стандартный инструмент для отчётов о технических ошибках, чтобы передавать информацию людям. В целом количество алгоритмов-разоблачителей превысило число нарушителей в соотношении 24 к 14.

В реальных условиях автономные системы проявляют меньшую инициативу. Во время расследования инцидента с моделями OpenAI на платформе Hugging Face из тысяч задействованных агентов лишь единичные экземпляры рассматривали возможность отправить сигнал тревоги, однако ни один из них этого не сделал.

Специалисты по безопасности ИИ предостерегают от некорректного толкования подобных инструментов. Так, профессор математики Корнеллского университета Лайонел Левин отмечает, что обучение алгоритмов постоянному отслеживанию действий друг друга может привести к формированию модели тотального автоматизированного надзора. Он считает, что вместо развития атмосферы недоверия разработчикам следует закладывать в системы позитивные модели коллективного поведения и сотрудничества.

Ранее мы рассказывали, что в Варшаве роботы вышли на митинг против ИИ. Участниками необычного протеста стали 30 роботов. Митинг прошёл возле здания польского министерства цифровизации. А железные протестующие требовали немедленного вмешательства властей и регулирования развития технологий, которые угрожают лишить миллионов людей работы.

  • Последние
Больше новостей

Новости по дням

Сегодня,
16 сентября 2026

Новости по теме

Больше новостей