Китайский опенсорс: Z.ai придерживает веса GLM-5.3, а Qwen3.8-27B уже доступна для RTX 3090!
Сразу две новости китайского опенсорса заслуживают внимания: одна тревожная, вторая хорошая.
GLM-5.3: веса придержали из-за киберспособностей
Z.ai выпустили GLM-5.3. Это сильная модель, но ее веса не появятся как минимум в ближайшие две недели. Причина в том, что модель начала показывать заметные киберспособности.
Слоган GLM-5.3 звучит как «Built to Code. Ready for Cyber Defense», что переводится как «Создана для кода. Готова к киберзащите». Защитные навыки действительно хорошие.
На CyberGym, тесте, где требуется найти уязвимость и доказать, что она настоящая, GLM-5.3 набрала 84,5%. У Claude Mythos 5 результат 83,8%, у GPT-5.6 Sol 83,6%, а у прошлой GLM-5.2 было 77,2%. Это первый случай, когда китайская модель обошла закрытый американский фронтир в поиске уязвимостей.
Вместе с командами Университета Цинхуа, Нанькайского университета и несколькими компаниями по безопасности Z.ai прогнала свои модели по реальному коду. Итог: 2436 уязвимостей в 269 проектах, 1097 из них критические или высокой степени серьезности. Самая старая находка пролежала в коде с 1981 года, а средний возраст уязвимости до обнаружения составил 26,6 года.
Почему веса придержали? На ExploitBench, где находку нужно довести до работающего эксплойта, у GLM-5.3 показатель 54,4%, тогда как у GLM-5.2 было 24,4%. У Mythos 5 результат 78%, у GPT-5.6 Sol 76,5%. На первый взгляд GLM сильно позади, но закрытые модели сдерживаются классификаторами безопасности на уровне интерфейсов, а с открытыми весами такой трюк не пройдет.
Разработчиков напугало не то, что модель хорошо ищет баги. Этого как раз и добивались: данные по уязвимостям добавили в дообучение осознанно. Расчет был на умеренное улучшение, чтобы модель аккуратнее находила подозрительный код. Однако в ходе тестов разработчики заметили: в рассуждениях модель не просто находит баги, а сразу строит опирающийся на них план кибератаки. Чем дальше масштабировали обучение, тем быстрее разгонялась эта способность, быстрее, чем предсказывали собственные прогнозы. Как разработчики планируют это исправлять и уложатся ли в две недели, неизвестно.
Уже сейчас GLM-5.3 доступна в API и подписках, под прикрытием классификаторов безопасности. По бенчмаркам это хорошая модель, которая незначительно уступает Claude Fable 5 / Opus 5, GPT-5.6 Sol и Kimi K3.
Для большинства пользователей интерес к GLM-5.3 скорее исследовательский: это большая модель на 763 млрд весов, поэтому для запуска потребуется несколько профессиональных GPU. Но в один день с ней вышла модель, которую вполне реально запускать на топовых видеокартах RTX 3090/4090/5090, а с квантизацией и на картах попроще.
Qwen3.8-27B: открытая модель с поддержкой изображений и видео
Речь о Qwen3.8-27B.
Модель получила рассуждающий режим, который страхует от совсем глупых ответов. Кроме того, она не чисто текстовая: на вход принимает также изображения и видео.
Если сравнивать с Qwen3.6-27B, рост в бенчмарках составляет примерно на 10-30% при том же размере модели. В открытых весах сейчас идет очень сильный алгоритмический прогресс: купив один раз подержанную RTX 3090, можно каждые несколько месяцев получать под нее модель, которая заметно растет в результатах.
Мы попросили Opus 5 сравнить, какому поколению фронтирных моделей соответствует Qwen3.8-27B. По его оценке, это уровень GPT-5.3-Codex или Claude Opus 4.6, а в некоторых областях модель дотягивается до GPT-5.4 и Opus 4.7. То есть это уровень ИИ, который весной казался самым топовым.
Бенчмарки не дают полной оценки качества. В маленьких моделях меньше знаний, поэтому на многих нишевых вопросах они отвечают хуже. Но прогресс все равно впечатляет, и интересно, как долго его получится сохранять на том же размере без роста требований к железу.

