Бенчмарк стоимости решения задач: Kimi K3 дорожает, лидерство у DeepSeek V4 Flash.
Мы наконец получили прикладной бенчмарк стоимости решения задач, который давно ждали. Сравнивается эффективность моделей относительно их цены.
Основные результаты:
- Kimi K3 совершил рывок вперёд и заметно подорожал, однако всё ещё остаётся в два раза дешевле Opus и значительно дешевле Fable.
- Среди моделей, действительно способных решать практические задачи, лидирует DeepSeek V4 Flash.
- В зелёной зоне оптимальности расположились Luna Max, GLM-5.2 и Grok 4.5. Эти модели эффективно справляются с задачами, если их возможностей для этого хватает.
Отдельно редакция хочет выделить Luna Max. Эта модель кажется нам сильно недооценённой: она отлично работает за свою цену и заслуживает большего внимания.

