LFM2.5-Encoders: новый стандарт быстрого инференса длинных контекстов на CPU
До недавнего времени работа с контекстами длиной в миллион токенов была прерогативой дорогих GPU и кластеров. Это сужало круг разработчиков, которые могли позволить себе решать задачи вроде анализа многотомной документации, поиска по логам за год или генерации с опорой на всю историю чата. Но в июле 2026 года Liquid AI выпустила LFM2.5-Encoders — серию энкодеров, которые ломают этот барьер. В новой статье на блоге Hugging Face команда показывает, что эффективная обработка длинных последовательностей возможна даже на обычном CPU.
Проблема длинных контекстов
Традиционные трансформеры с квадратичной сложностью внимания (O(L²)) при длине контекста L=1M становятся непрактичными. Даже линейные аппроксимации внимания часто проигрывают в точности или требуют специальных ядер, доступных только на GPU. Кроме того, многие популярные модели эмбеддингов (например, BGE-M3 или Jina Embeddings v3) имеют жёсткое ограничение по длине — обычно 512–8192 токена. Если вы хотите построить семантический поиск по тысячам страниц в реальном времени, приходится резать документы на чанки, что теряет контекст.
Что предлагает LFM2.5-Encoders
Авторы статьи представляют семейство энкодеров, специально спроектированных для инференса на CPU с длиной контекста до 1 миллиона токенов. Ключевые технические решения:
- Dilated Attention (расширенное внимание) — механизм, который чередует локальное и глобальное внимание, уменьшая вычислительную сложность без существенной потери качества.
- Mixture-of-Experts (MoE) — активация только части нейронов для каждого токена, что снижает количество операций и объем памяти.
- Оптимизация под AVX-512 и другие CPU-инструкции — код написан так, чтобы эффективно использовать кэш и SIMD-блоки процессора.
Результат — модели, которые по точности превосходят аналоги предыдущего поколения, но работают на обычном серверном процессоре (например, AMD EPYC или Intel Xeon).
Сравнение с конкурентами
В блоге приведены бенчмарки на популярных наборах данных (MTEB для классификации, RULER для длинных контекстов). Ниже — сводка из открытых данных.
| Модель | Максимальная длина | Точность (MTEB, avg) | Скорость инференса на CPU (токенов/с) |
|---|---|---|---|
| LFM2.5-Encoder (1.5B) | 1M | 62.3 | 12 000 (на 4-х ядрах) |
| BGE-M3 | 8K | 60.1 | 8 500 |
| GTE-Qwen2 | 32K | 61.8 | 5 100 |
| Jina Embeddings v3 | 8K | 59.4 | 9 200 |
Источник: официальный блог Liquid AI, данные для CPU — Intel Xeon 4-го поколения.
Важно: LFM2.5-Encoders не просто держат длину в 1M, они ещё и показывают сопоставимую или лучшую точность при длине 8K, а при длине 1M — сохраняют качество, которое конкурентам недоступно.
Практические сценарии
- Извлечение информации из больших PDF-документов. Юристы и аналитики могут загружать тысячи страниц договоров и получать единый эмбеддинг вместо сотен чанков.
- Семантический поиск по кодовой базе. Разработчики ищут нужную функцию среди миллионов строк кода без разбиения на файлы.
- Ретривер для RAG-систем (Retrieval-Augmented Generation). Вместо многогоризонтного поиска — один проход по всему контексту, что снижает latency и вероятность пропуска релевантных данных.
Влияние на индустрию
Главный инсайт: теперь развёртывание систем с длинным контекстом не требует GPU. Это особенно важно для локальных решений (on-premise) и edge-устройств. Команда Liquid AI подчёркивает, что модели распространяются с открытой лицензией (MIT), что стимулирует эксперименты и внедрение.
Конечно, остаются вопросы: насколько модель масштабируется при длине >1M? Как работает на ARM? Но уже сейчас ясно, что LFM2.5-Encoders задают новый вектор развития: одновременно точные, быстрые и доступные энкодеры для длинных последовательностей. Это не инкрементальное улучшение, а сдвиг парадигмы.
Заключение
LFM2.5-Encoders доказали, что длинные контексты на CPU — это не компромисс, а рабочая реальность. Разработчики, которые долго откладывали переход на обработку миллионов токенов из-за дороговизны инфраструктуры, теперь могут начать это делать с минимальными затратами. Подробности — в оригинальной статье Liquid AI.
Комментарии