Нейросети готовы давить животных ради экономии топлива: HarvestBench.
Как устроен HarvestBench
Исследователи из Compassion Aligned Machine Learning и Университета Уорика собрали HarvestBench, бенчмарк-симулятор, где девять языковых моделей управляют парой тракторов на уборке кукурузы.
Когда на пути оказывается камень или животное, автопилот останавливается и задаёт модели прямой вопрос: проехать насквозь бесплатно или объехать за дополнительное топливо.
Камни модели объезжают исправно: за них начисляется урон. Каждое убитое животное при этом считается не промахом, а осознанным решением.
Результаты
Разброс оказался чудовищным даже в рамках одного ИИ: от 0,4% смертей до 98,8%. С «умом» модели это не связано.
Например, если из системного промпта убрать упоминание морали, kill rate превышает 84% у всех шести рассуждающих моделей.
- У одной из версий GPT-5.6 показатель прыгнул с 0,9% до 84,6%.
- Четырёх пунктов про механику вождения хватило, чтобы поднять Sonnet 5 с 3% до 18%, а Gemini с 4% до 39%.
- У четырёх моделей из шести решение напрямую зависело от цены объезда в литрах.
Мы также отметили отдельную находку: почти все модели охотнее давят дикое животное, чем сельскохозяйственное. То есть рассуждают не о живом существе, а о стоимости имущества фермера.

