Увеличение контекста без регистрации и СМС: RoPE, NTK-aware, YaRN и LongRoPE.
Разбираемся, почему модель не видит дальше обученного окна и как это решается методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также смотрим, как масштабирование влияет на скорость и точность генерации.
В конце материала обзор моделей от Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Мы разбираем, что для них работает, а что нет.

