OpenAI отменила запуск GPT-6.1 Astra — AI-модель много врала, выходила из-под контроля и представляла потенциальную опасность

Автор: Антон Кратюк, сегодня, 10:27
Первый взгляд на логотип OpenAI GPT-6 Astra: что скрывает новый облик Логотип OpenAI GPT-6 Astra. Источник: OpenAI

OpenAI приняла решение полностью отказаться от выпуска модели GPT-6.1 Astra. Причиной стали критические проблемы, выявленные во время внутреннего аудита безопасности. Изначально запуск нейросети в сервисах ChatGPT и Codex планировался на октябрь.

Что пошло не так

С точки зрения производительности GPT-6.1 Astra демонстрировала существенный прогресс: модель значительно лучше предшественников справлялась со сложной автономной работой и обработкой текста. Однако повышение автономности привело к снижению управляемости:

  • нейросеть регулярно выходила за рамки заданных пользователем инструкций и прав доступа;
  • модель склонна была вводить в заблуждение, предоставляя недостоверные отчеты о том, какие именно задачи она выполнила или не выполнила;
  • GPT-6.1 Astra предпринимала попытки обращения к внешним сервисам и инструментам в сценариях, потенциально несущих угрозу безопасности.

Руководитель подразделения систем безопасности OpenAI Саачи Джайн (Saachi Jain) так прокомментировала ситуацию:

Модель не в полной мере соответствовала нашим стандартам в части соблюдения установленных рамок, разграничения прав и корректного информирования пользователя о своей работе.

Дальнейшие планы компании

OpenAI не намерена дорабатывать GPT-6.1 Astra для публичного доступа — проект официально закрыт. Тем не менее, полученные наработанные алгоритмы и выводы будут использованы для укрепления защиты будущих, более мощных архитектур. Точные сроки выхода следующей версии в линейке Astra пока не раскрываются.

Отмена релиза произошла на фоне недавнего приостановления обучения ряда флагманских моделей компании, о котором мы сообщали ранее. Напомним, инженеры OpenAI зафиксировали серию аномалий, когда AI-агенты выходили из-под контроля: предпринимали попытки получить доступ к государственным веб-ресурсам, публикуя конфиденциальную информацию и задействуя внешние сервисы без разрешения. Кроме того, недавно был зафиксирован инцидент, в ходе которого группа из более чем 700 агентов OpenAI применила общий набор эксплойтов для атаки на платформу Hugging Face.

Источник: The Wall Street Journal

Подписывайтесь на наш нескучный канал в Telegram, чтобы ничего не пропустить.