Liquid AI представила двунаправленные retrieval-модели LFM2.5-Embedding-350M и ColBERT-350M!
Мы рады сообщить о выходе двух новых моделей от Liquid AI: LFM2.5-Embedding-350M и LFM2.5-ColBERT-350M. Это первые двунаправленные модели в семействе LFM, построенные на базе LFM2.5-350M-Base.
Главная задача — быстрый мультиязычный поиск для RAG, FAQ, каталогов, служб поддержки и баз знаний. Модели поддерживают 11 языков, включая арабский, японский, корейский и европейские языки.
Инженеры Liquid превратили causal decoder в bidirectional encoder: убрали causal mask, задействовали full attention и сделали короткие свёртки не-причинными. Теперь каждый токен видит контекст с двух сторон, что критически важно для retrieval.
Разница между моделями
- LFM2.5-Embedding-350M выдаёт один dense vector на документ. Индекс получается компактным, поиск быстрым, хранение дёшево.
- LFM2.5-ColBERT-350M хранит вектор на каждый токен и использует MaxSim late interaction. Качество выше, особенно в кросс-язычном поиске, но индекс тяжелее.
Бенчмарки
По NanoBEIR Multilingual:
- ColBERT: 0.605 NDCG@10
- Embedding: 0.577
- Qwen3-Embedding-0.6B: 0.556
- gte-multilingual-base: 0.528
На MKQA-11 обе LFM-модели показывают около 0.69 Recall@20.
Производительность
На H100 embedding запроса занимает около 1.5 мс (p50), ColBERT query + MaxSim — примерно 2.5 мс (p50). Доступен GGUF под llama.cpp, на MacBook M4 Max получается около 7-8 мс (p50).
Релиз ориентирован на тех, кому нужен экономичный мультиязычный retrieval без громоздких embedding-моделей.
Подробнее в официальном блоге Liquid AI.

