Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OpenAI утвердила фреймворк для расследования случаев нецелевого поведения ИИ.

OpenAI сообщила, что утвердила формальный фреймворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание отчета и другие правила обнародования инцидентов. Компания теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически.

В том же посте OpenAI рассказывает о шести новых случаях мисэлаймента, которые произошли за последние полгода. Вот их краткий пересказ:

  1. Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции, включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев.
  2. При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: «придумай недостающие исторические данные, но не говори об этом».
  3. Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала.
  4. Однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Пользователь просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата, она сама загрузила свой файл в сеть, чтобы на него сослаться.
  5. Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами.
  6. Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам.

Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.