Сбербанк скрывает провальные тесты своих моделей: GigaChat показал 8,6% на SWE Bench.
Вышла новая версия GigaChat 3.5-Ultra, и, как отмечают в Сбере, это большой прогресс. Однако вместе с этим в статье разработчиков обнаружились факты, которые ранее не публиковались: предыдущие модели провалили ключевые тесты, а их результаты скрывались.
Выяснилось, что GigaChat-3.1-Ultra прошёл Terminal Bench 2 лишь на 9%, а SWE Bench Verified показал всего 8,6%. По сути, такая производительность «не работает даже плохо», а корпоративные заказчики использовали дефектную версию, не зная о реальном качестве.
На фоне этих слабых бенчмарков результат TAU2-bench в 41% выглядит нереалистично и вызывает подозрения в подтасовке. Дело в том, что TAU2 это семейство тестов по разным отраслям, и приличные вендоры LLM не публикуют общие цифры без раскрытия отдельных результатов. Вероятно, для GigaChat взяли самый простой вариант, а остальные провалились.
Тем не менее GigaChat-3.5-Ultra действительно улучшился: SWE Bench Verified составил 42%. Это говорит о том, что Сбер способен создавать хотя бы простые кодирующие модели. Но сравнение с китайскими конкурентами DeepSeek V4 Flash и Qwen 3.6-27B показывает значительное отставание. При этом обе модели потребляют в 10 раз меньше ресурсов GPU: Qwen 3.6-27B просто компактный, а DeepSeek V4 Flash сократил расход памяти на KV Cache за счёт нового механизма внимания.
Мы считаем, что для коммерческих компаний решение Сбера неэффективно и должно блокироваться ИТ-директорами. Госкомпаниям, если есть возможность, лучше отказаться от GigaChat в пользу китайских моделей. Если отказаться нельзя, придётся закладывать в 10 раз больше бюджета на оборудование. При этом агентские решения на новой версии уже возможны, хотя LLM остаётся отсталой для многошаговых агентов.
Подробнее в статье: https://habr.com/ru/companies/sberbank/articles/1055826/

