Google Research предложила Retrieve-for-Train: быстрый AI-поиск без длинного reasoning на каждом запросе.
Google Research предложила подход Retrieve-for-Train для ускорения сложного AI-поиска. Главная идея в том, чтобы не заставлять языковую модель каждый раз долго рассуждать и генерировать десятки sub-query, а перенести тяжёлую работу в обучение.
Как это устроено
query → RL-обученный fan-out LM → синтетические target-наборы → компактный diffusion retriever
На этапе inference больше не нужен большой chain-of-thought. Google Research обучила компактный diffusion retriever объёмом 53.9M параметров, который генерирует весь набор направлений поиска сразу, одним неавторегрессионным проходом.
Результаты
- в 12-20 раз быстрее autoregressive-подходов;
- latency остаётся от sub-second до нескольких секунд;
- выше diversity, alignment и recall;
- меньше дублирующихся sub-query;
- не нужны human labels для supervision.
Интересно, что RL здесь используется не как дорогой online reasoning engine, а как одноразовый механизм, который «компилирует» сложное поведение в более дешёвую модель.
Для production-поиска это сильная идея: сложное reasoning делается заранее, а inference остаётся быстрым.

