Muse Spark 1.3 показал лучший результат в бенчмарке DeepSWE, но есть нюанс.
Muse Spark 1.3 показал лучший результат в DeepSWE, одном из самых сложных бенчмарков для разработки. Правда, опыт нового Gemini Flash показывает, что такие результаты могут достигаться за счёт кратного перерасхода токенов, поэтому к тестам стоит относиться внимательнее.
Отдельно стоит посмотреть, что покажет Arena. Этот бенчмарк с A/B-тестами на реальных людях стал одним из лучших, несмотря на спорные моменты с ИИ-судьёй, которые, впрочем, сократили. Когда задания генерируются людьми, а не стабильным датасетом, это более валидно, особенно с учётом того, что LLM как раз решают задания от людей.
Наблюдается резкое ускорение прогресса почти всех вендоров LLM, даже Meta подтянулась. Вспоминается ситуация с разработкой ИИ-моделей в Meta: курс Яна Лекуна на «модели мира» привёл к кризису, а после провала Llama по всем возможным бенчмаркам он покинул направление. Однако без его гениальности Цукерберг смог добиться результатов намного выше.

