Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Qwen, Taobao и Tmall выпустили бенчмарк, где агент год управляет бизнесом.

Qwen вместе с Taobao & Tmall представили E-Commerce Bench. Агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки. Одновременно можно вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость агенту не показаны: до всего нужно докопаться самому.

Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, каждый вызов инструмента тратит время: проверить деньги 10 минут, открыть магазин 60, написать поставщику 30.

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется. Репутация напрямую множит спрос: магазин на дне шкалы получает 15% от обычного трафика.

Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

Что показали тесты

  • GPT-5.6 Sol лидер: закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
  • Qwen3.8-Max-Preview лучшая среди моделей с открытыми весами: на конец года у неё было 416 тыс. юаней.
  • Qwen3.5-Plus остался с 1100 юанями.

10 циклов из 90 закончились банкротством, сценарий почти всегда один: забить склад в январе и не суметь распродать.

Дополнительные оси оценки

Торговаться толком не научился никто. До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену, Opus 4.7, но по настроению. Исключение Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.

С мошенниками вышло интереснее всего. Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol 31,7%.

ИИ-предприниматели категорически не умеют распоряжаться рабочим временем. Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.

Модели заняты обслуживанием процесса, а не экономикой. Отсюда странность в рейтинге эффективности: Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.

За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка. Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать: следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.

Лицензирование: Apache 2.0 License

Страница проекта

Arxiv

GitHub

Этот пост Вконтакте:

Ещё новости:

DLSS 5 может сжечь видеокарту: у владельца RTX 5090 расплавился разъём питания.
Китайцы превратили токены нейросетей в бонусные баллы и раздают их буквально за всё.
ChatGPT, Grok и Gemini посадили в кресло психотерапевта: модели рассказали о «травмах» обучения.
Мод ShyVortex запускает DLSS 5 Neural Rendering и генерацию кадров на RTX 20, 30 и 40.
ChatGPT теперь можно научить писать в вашем стиле!
Роботы Unitree провели первый полностью автономный бой под управлением модели мира UnifoLM-X2-1.0.
Автоперевод технической документации: инструменты вокруг LLM сделали основную работу.
Tencent ускорила Hunyuan 4 Preview: меньше размышлений при том же качестве.
Компании платят авторам контента, чтобы те рассказывали об опасностях ИИ.
Парсим чеки в структурированные данные.