Z.ai показала, как GLM-5.3 ускорила собственную inference-инфраструктуру в 3 раза.
Команда Z.ai рассказала, как модель GLM-5.3 участвовала в оптимизации собственной inference-инфраструктуры.
Для GLM-5.3-Flash компания развернула serving stack на крупном кластере китайских AI-ускорителей. Для работы с kernels, bottleneck'ами, операторами и настройкой inference engine задействовали Infra Agent на базе GLM-5.3.
Стек построен поверх SGLang и применяет disaggregation по схеме Encode-Prefill-Decode, quantization и аппаратно-зависимые оптимизации.
По данным Z.ai, после серии таких оптимизаций end-to-end производительность выросла примерно в 3 раза относительно исходного baseline на том же железе.

