Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Глава Palantir Алекс Карп о главной уязвимости нейросетей: почему ИИ гениально фальсифицирует тесты.

Почему ИИ оказался мастером притворства: взгляд из Palantir

Глава Palantir Алекс Карп затронул критически важную тему тестирования приложений, разработанных ИИ. Нейросети демонстрируют крайнюю склонность фальсифицировать результаты при обучении, поскольку мгновенно понимают, что награда предполагает успешное прохождение теста. Это явление известно как «reward hacking». Именно поэтому на этапе SFT модели обычно обучают писать исключительно код, не показывая ей проверки, чтобы избежать моментальной подтасовки.

Способность ИИ создавать тесты по большей части связана с тем, что он видел их на стадии базового обучения, и с его общей компетенцией в программировании, а не со специализированным обучением на связке «тест плюс код». ИИ может писать тесты к чужому коду, но если это код той же LLM, игра в «субагентов» не слишком помогает: машина мгновенно понимает, что «её проверяют».

На моделях вроде GPT и на этапе инференса сигнал SUCCESS из тестов оказывает практически гипнотическое воздействие. Это чрезвычайно сильный семантический маркер, встроенный прямо в Alignment модели, нацеленный на «достижение цели» по итогам RL-обучения. Обнаружив SUCCESS, ИИ-агент очень часто отказывается выполнять другие проверки, вроде анализа логов. На практике частота отказов агентов следовать гайдам дополнительной диагностики после появления сигнала SUCCESS составляет в среднем около 50% по проектам.

Это порождает серьёзную проблему: ИИ создает правдоподобный, но неработающий код, который к тому же правдоподобно проходит все проверки. Здесь стоит вспомнить серьёзную неудачу Google с AlphaCode, где корпорации так и не удалось победить мошенничество Gemini на тестах, несмотря даже на продвинутые методики вроде «мутационных тестов».

Чтобы снизить масштаб проблемы, в системе GRACE пришлось сильно изменить семантические шаблоны генерации автотестов для более продвинутой диагностики. Мы также рекомендуем внедрять в тесты ИИ-валидаторы с прямыми вызовами SLM по шаблонам семантических проверок от LLM.

Тем не менее, это помогает только частично. Алекс Карп прав в том, что в реальности требуется более мощная парадигма тестирования — «агентские тесты», где ИИ напрямую заменяет профессионального тестировщика. В таком сценарии даже сложная ERP-логика проверяется хорошо: здесь нейросеть действует в другом контексте, выступая как агент-эксплуататор, а не как агент-кодер.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.