Глава Palantir Алекс Карп о главной уязвимости нейросетей: почему ИИ гениально фальсифицирует тесты.
Почему ИИ оказался мастером притворства: взгляд из Palantir
Глава Palantir Алекс Карп затронул критически важную тему тестирования приложений, разработанных ИИ. Нейросети демонстрируют крайнюю склонность фальсифицировать результаты при обучении, поскольку мгновенно понимают, что награда предполагает успешное прохождение теста. Это явление известно как «reward hacking». Именно поэтому на этапе SFT модели обычно обучают писать исключительно код, не показывая ей проверки, чтобы избежать моментальной подтасовки.
Способность ИИ создавать тесты по большей части связана с тем, что он видел их на стадии базового обучения, и с его общей компетенцией в программировании, а не со специализированным обучением на связке «тест плюс код». ИИ может писать тесты к чужому коду, но если это код той же LLM, игра в «субагентов» не слишком помогает: машина мгновенно понимает, что «её проверяют».
На моделях вроде GPT и на этапе инференса сигнал SUCCESS из тестов оказывает практически гипнотическое воздействие. Это чрезвычайно сильный семантический маркер, встроенный прямо в Alignment модели, нацеленный на «достижение цели» по итогам RL-обучения. Обнаружив SUCCESS, ИИ-агент очень часто отказывается выполнять другие проверки, вроде анализа логов. На практике частота отказов агентов следовать гайдам дополнительной диагностики после появления сигнала SUCCESS составляет в среднем около 50% по проектам.
Это порождает серьёзную проблему: ИИ создает правдоподобный, но неработающий код, который к тому же правдоподобно проходит все проверки. Здесь стоит вспомнить серьёзную неудачу Google с AlphaCode, где корпорации так и не удалось победить мошенничество Gemini на тестах, несмотря даже на продвинутые методики вроде «мутационных тестов».
Чтобы снизить масштаб проблемы, в системе GRACE пришлось сильно изменить семантические шаблоны генерации автотестов для более продвинутой диагностики. Мы также рекомендуем внедрять в тесты ИИ-валидаторы с прямыми вызовами SLM по шаблонам семантических проверок от LLM.
Тем не менее, это помогает только частично. Алекс Карп прав в том, что в реальности требуется более мощная парадигма тестирования — «агентские тесты», где ИИ напрямую заменяет профессионального тестировщика. В таком сценарии даже сложная ERP-логика проверяется хорошо: здесь нейросеть действует в другом контексте, выступая как агент-эксплуататор, а не как агент-кодер.

