По данным FT, ByteDance обучает модель до 10 триллионов параметров.
По данным Financial Times, ByteDance обучает модель масштабом до 10 триллионов параметров.
Это примерно в 3,6 раза больше, чем у Kimi K3 от Moonshot AI с её 2,8 триллиона параметров. По масштабу проект потенциально сопоставим с крупнейшими системами Anthropic.
Сейчас модель ByteDance находится на стадии pre-training. Источники Financial Times говорят о конфигурации до 10 триллионов параметров, но сама ByteDance публично характеристики не подтвердила, а Reuters не смог независимо проверить эту цифру.
Отметим: 10 триллионов параметров не означает автоматически лучшую модель. Если архитектура использует Mixture-of-Experts, на каждом токене может активироваться лишь небольшая часть всей сети. Kimi K3, например, при 2,8 триллиона общих параметров активирует только часть экспертов.
Источник: X-пост Lentils80

