NVIDIA представила Nemotron 3 Embed — открытые модели для RAG, агентного поиска и памяти агентов.
Компания NVIDIA анонсировала семейство открытых embedding-моделей Nemotron 3 Embed. Решение ориентировано на RAG, агентный поиск, поиск по коду и работу с памятью автономных агентов.
Флагманская модель Nemotron-3-Embed-8B-BF16 уже признана лучшей в мультиязычном бенчмарке RTEB по состоянию на 16 июля 2026 года. Этот retrieval-бенчмарк оценивает, насколько точно embedding-модель находит релевантный контекст для RAG-пайплайнов.
Зачем это агентам
Когда retrieval ошибается, агент получает мусорный контекст. За этим следуют лишние поиски, удлиняется цепочка рассуждений, растёт число токенов и увеличивается счёт за инференс.
Три модели в линейке
- Nemotron-3-Embed-8B-BF16 — максимум качества.
- Nemotron-3-Embed-1B-BF16 — дешевле и быстрее для продакшена.
- Nemotron-3-Embed-1B-NVFP4 — версия, оптимизированная под Blackwell и vLLM, квантованная с помощью NVIDIA Model Optimizer.
Все модели поддерживают входную длину до 32 тысяч токенов, что позволяет индексировать длинные документы, исходный код и историю агента без чересчур агрессивной нарезки.
Версия 1B-NVFP4 на RTEB показывает почти тот же результат, что и BF16: 72,00 против 72,38, при этом embedding-пространство совместимо с 1B-BF16.
Подробности и метрики можно изучить в официальном блоге NVIDIA на Hugging Face.

