RTK не дал обещанной экономии токенов в Claude Code и DeepSeek.
Мы разобрались в результатах проверки утилиты RTK с 79 тысячами звёзд. Она сжимает вывод терминала перед тем, как его прочитает агент, и обещает срезать до 90% вывода bash. В соцсетях это превратилось в «Claude Code тратит на 60% меньше токенов». Quesma проверила на Terminal-Bench 2.1: 1740 прогонов, больше $1500 на токены, Claude Code с Fable 5.0 и OpenCode с DeepSeek V4 Pro, каждая задача запускалась по пять раз с RTK и без него.
Результаты замеров
Расход на одну решённую задачу у Fable с RTK оказался ниже на 3%, у DeepSeek выше на 7%. Почти вся экономия Fable пришла из одной задачи, где агент уложился вдвое меньшим числом ходов, по остальным меньше процента. У DeepSeek та же задача пошла наоборот, а если считать среднее по задачам, он стал дороже на 17%, Fable на 1%. Доля решённых задач упала на 1-2 пункта у обоих.
Что не так со счётчиком rtk gain
Счётчик rtk gain, который часто мелькает в постах, показывает байты вырезанного вывода, делённые на четыре, и не имеет отношения к оплаченным токенам. В одной задаче модель дважды запросила head -1 от файла, а RTK записал себе 120 млн сэкономленных токенов за каждый вызов, сравнив одну строку с целым файлом. Обнаружился ещё один баг: rtk find не знал флаг из команды агента, плагин переписывал команду снова и снова, и агент накопил 339 ошибок подряд. Починили в 0.46.0, уже после замеров.

