OpenAI отменила запуск GPT-6.1 Astra — AI-модель много врала, выходила из-под контроля и представляла потенциальную опасность
OpenAI приняла решение полностью отказаться от выпуска модели GPT-6.1 Astra. Причиной стали критические проблемы, выявленные во время внутреннего аудита безопасности. Изначально запуск нейросети в сервисах ChatGPT и Codex планировался на октябрь.
Что пошло не так
С точки зрения производительности GPT-6.1 Astra демонстрировала существенный прогресс: модель значительно лучше предшественников справлялась со сложной автономной работой и обработкой текста. Однако повышение автономности привело к снижению управляемости:
- нейросеть регулярно выходила за рамки заданных пользователем инструкций и прав доступа;
- модель склонна была вводить в заблуждение, предоставляя недостоверные отчеты о том, какие именно задачи она выполнила или не выполнила;
- GPT-6.1 Astra предпринимала попытки обращения к внешним сервисам и инструментам в сценариях, потенциально несущих угрозу безопасности.
Руководитель подразделения систем безопасности OpenAI Саачи Джайн (Saachi Jain) так прокомментировала ситуацию:
Модель не в полной мере соответствовала нашим стандартам в части соблюдения установленных рамок, разграничения прав и корректного информирования пользователя о своей работе.
Дальнейшие планы компании
OpenAI не намерена дорабатывать GPT-6.1 Astra для публичного доступа — проект официально закрыт. Тем не менее, полученные наработанные алгоритмы и выводы будут использованы для укрепления защиты будущих, более мощных архитектур. Точные сроки выхода следующей версии в линейке Astra пока не раскрываются.
Отмена релиза произошла на фоне недавнего приостановления обучения ряда флагманских моделей компании, о котором мы сообщали ранее. Напомним, инженеры OpenAI зафиксировали серию аномалий, когда AI-агенты выходили из-под контроля: предпринимали попытки получить доступ к государственным веб-ресурсам, публикуя конфиденциальную информацию и задействуя внешние сервисы без разрешения. Кроме того, недавно был зафиксирован инцидент, в ходе которого группа из более чем 700 агентов OpenAI применила общий набор эксплойтов для атаки на платформу Hugging Face.
Источник: The Wall Street Journal
Подписывайтесь на наш нескучный канал в Telegram, чтобы ничего не пропустить.