Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

ИИ-агенты справились всего с 2.5% реальных задач фрилансеров.

Исследователи проверили, насколько ведущие ИИ-агенты готовы заменить фрилансеров на практике. Для этого они взяли 240 реальных проектов с биржи Upwork — от создания игр до архитектурных чертежей — и создали на их основе специальный тест под названием Remote Labor Index.

Как проходило тестирование

Методология была простой и честной. Учёные нашли выполненные и оплаченные заказчиками работы фрилансеров. Затем они дали ИИ-агентам те же самые технические задания и исходные файлы. Работа реального специалиста стала эталоном качества, который уже прошёл проверку рынком.

Результаты лидеров

Лучший результат показал агент Manus, который смог правильно выполнить лишь 2.5% проектов. Далее следуют Grok 4 и Sonnet 4.5 с результатом 2.1%. GPT-5 справился с 1.7% задач, ChatGPT agent — с 1.3%, а Gemini 2.5 Pro — всего с 0.8%.

Где ИИ чаще всего ошибался

Анализ неудач выявил основные проблемы:

  • Низкое качество (45.6% случаев): примитивная графика вместо профессиональной или роботизированный голос в аудиозаписях.
  • Незавершённая работа (35.7%)
  • Битые или пустые файлы (17.6%).
  • Несогласованность (14.8%): разные части проекта, например 3D-рендеры одного здания, не совпадали между собой.

Сильные стороны ИИ

При этом в некоторых областях ИИ-агенты показали себя на уровне человека или даже лучше. Это задачи по редактированию аудио, генерации рекламных изображений, написанию отчётов и созданию интерактивных дашбордов для данных.

Код бенчмарка и примеры проектов доступны на GitHub.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.