Cognition выпустила SWE-2: модель для кода уровня флагманов при цене до 70% ниже.
Cognition выпустила SWE-2, самую близкую к фронтиру модель для кода. На бенчмарках она держится вровень с флагманами при цене до 70% ниже. Внутри Kimi K3 на 2,8 трлн параметров, поверх которой Cognition докрутила RL, впервые в таком масштабе.
Главная идея обучения: все уровни рассуждений тренируются в одном прогоне RL, а штраф за стоимость подбирается под наклон кривой цена-качество у базовой модели. Так сдвигается вся кривая, а не одна точка на ней. Судя по таблице, SWE-2 идет вровень с Fable 5.1 и GPT-5.6 Sol, до GPT-6 Astra не хватает нескольких пунктов при четверти её цены, а на Terminal-Bench 2.1 модель обошла всех.
Поведение тоже изменилось: модель меньше копается в репозитории и раньше начинает править. На FrontierCode первое реальное редактирование делает в среднем на 18-м шаге против 48-го у SWE-1.7, ходов на 58% меньше, прогон на 81% дешевле.
Попробовать SWE-2 можно в Devin Desktop и CLI, в Devin Web доступ выкатывают. Разбор обучения опубликован в блоге Cognition.

