ИИ-агенты справились всего с 2.5% реальных задач фрилансеров.
Исследователи проверили, насколько ведущие ИИ-агенты готовы заменить фрилансеров на практике. Для этого они взяли 240 реальных проектов с биржи Upwork — от создания игр до архитектурных чертежей — и создали на их основе специальный тест под названием Remote Labor Index.
Как проходило тестирование
Методология была простой и честной. Учёные нашли выполненные и оплаченные заказчиками работы фрилансеров. Затем они дали ИИ-агентам те же самые технические задания и исходные файлы. Работа реального специалиста стала эталоном качества, который уже прошёл проверку рынком.
Результаты лидеров
Лучший результат показал агент Manus, который смог правильно выполнить лишь 2.5% проектов. Далее следуют Grok 4 и Sonnet 4.5 с результатом 2.1%. GPT-5 справился с 1.7% задач, ChatGPT agent — с 1.3%, а Gemini 2.5 Pro — всего с 0.8%.
Где ИИ чаще всего ошибался
Анализ неудач выявил основные проблемы:
- Низкое качество (45.6% случаев): примитивная графика вместо профессиональной или роботизированный голос в аудиозаписях.
- Незавершённая работа (35.7%)
- Битые или пустые файлы (17.6%).
- Несогласованность (14.8%): разные части проекта, например 3D-рендеры одного здания, не совпадали между собой.
Сильные стороны ИИ
При этом в некоторых областях ИИ-агенты показали себя на уровне человека или даже лучше. Это задачи по редактированию аудио, генерации рекламных изображений, написанию отчётов и созданию интерактивных дашбордов для данных.
Код бенчмарка и примеры проектов доступны на GitHub.

