Я последние несколько лет работаю с LLM в реальных бизнес-процессах — автоматизация клиентской поддержки, генерация контента, анализ данных. И каждый раз упираюсь в одну и ту же стену: модели либо слишком дороги в развертывании, либо слишком медленны, либо их память и контекстное окно не позволяют обрабатывать длинные цепочки рассуждений. В июне 2026 года появилась новость, которая может изменить правила игры. Источник
Речь о стартапе, который заявляет, что решил проблему, десятилетиями тормозившую развитие языковых моделей. Речь не про очередное увеличение количества параметров — это про то, как сделать модели доступными для реального применения без космических затрат. Давайте разберемся, что именно они придумали и почему это может стать (а может и не стать) прорывом.
Что это за bottleneck и почему он всех бесит
Любой, кто плотно работал с LLM (GPT-4, Claude, Gemini последней версии), знает: главная проблема не в том, что модель плохо генерирует текст. Проблема в том, что она потребляет чудовищные ресурсы. Каждый запрос — это дорого. Каждый миллион токенов — это сотни долларов. А если нужно сделать модель умнее на ваших данных (fine-tuning), то это вообще отдельная история с дата-центрами.
Но есть и другая сторона — так называемый «контекстный bottleneck». Модели с трудом удерживают длинные контексты. Окна в 128K токенов уже есть, но качество работы на длинном контексте резко падает. Стартап, о котором идет речь, утверждает, что обошел это ограничение на архитектурном уровне.
Что конкретно сделал стартап
По данным MIT Technology Review, команда разработала новый метод обучения и инференса, который позволяет модели обрабатывать последовательности длиной до 10 миллионов токенов без потери качества. Для сравнения: текущий стандарт — 128K–1M токенов. Это не просто цифры — это возможность анализировать всю документацию компании, код репозитория или переписку за год в одном запросе.
Технически они модифицировали механизм внимания (attention). Вместо того чтобы на каждом шаге пересчитывать все связи между токенами (что даёт сложность O(n²)), они ввели разреженное внимание с динамическим выделением релевантных участков. Это снижает вычислительную сложность до O(n log n). На практике это означает, что модель может работать с длинными документами, не замедляясь экспоненциально.
Сравнение с текущими подходами
| Параметр | Текущие LLM (GPT-4, Claude 3.5) | Новая технология стартапа |
|---|---|---|
| Максимальная длина контекста | 128K–1M токенов | До 10M токенов |
| Сложность инференса | O(n²) | O(n log n) |
| Качество на длинных контекстах | Падает после 50K | Заявлено стабильное |
| Стоимость за 1M токенов | $10–30 (API) | Заявлено <$1 |
| Доступность | Широко, через API | Только в закрытом бета-тесте |
Цифры выглядят многообещающе, но пока это заявления. Насколько они соответствуют реальности — увидим после публичных релизов.
Как это может изменить бизнес-применение LLM
Я вижу несколько сценариев, где это может быть прорывом:
- Юридический анализ. Представьте, что вы можете загрузить весь договорной архив компании (сотни тысяч страниц) и задать один вопрос: «Найди все пункты, где мы рискуем штрафами». Сейчас это требует разбивки на тысячи запросов.
- Код-ревью. Разработчики смогут анализировать целые репозитории как единый контекст, а не только отдельные файлы.
- Медицина. Анализ полной истории болезни пациента за 20 лет — сейчас это невозможно из-за ограничений по длине.
Но есть и обратная сторона: чем длиннее контекст, тем больше вероятность, что модель «забудет» важные детали в середине. Даже если сложность снижена, проблема «потери внимания» остаётся. Стартап утверждает, что решил и это, но я бы подождал независимых тестов.
Что говорят скептики
Не все в восторге. Некоторые эксперты указывают, что разреженное внимание — известная идея (например, в моделях типа Longformer). Проблема в том, что на коротких контекстах разреженное внимание часто работает хуже полного. Стартап, вероятно, нашёл способ переключаться между режимами, но деталей пока мало.
Другой риск — стоимость. Если они действительно снизили цену до <$1 за 1M токенов, это может обрушить рынок API-провайдеров. Но такие заявления мы слышали и раньше — вспомните «вечный двигатель» стартапов по дешевому ИИ.
Мой прогноз
Я оптимист. Даже если заявленные цифры завышены в 2–3 раза, это всё равно прогресс. Для моего бизнеса — автоматизация обработки договоров и отчетов — контекст в 1M токенов уже решит 90% задач. Если же они действительно выйдут на 10M, это изменит подход к построению AI-агентов.
Пока я планирую следить за бета-тестом и, если появится доступ, протестировать на своих данных. Главное — не поддаваться хайпу, а ждать объективных бенчмарков.
Как подготовиться к изменениям уже сейчас
Даже если технология стартапа не взлетит, тренд на удлинение контекста очевиден. Через год-два все крупные игроки предложат контексты от 1M токенов. Что делать бизнесу:
- Пересмотрите архитектуру хранения данных. Если вы храните документы в виде мелких фрагментов, это может стать узким местом. Готовьтесь к тому, что модели смогут «читать» целиком.
- Тестируйте длинные запросы уже сейчас. Возьмите Claude 3.5 или Gemini 1.5 Pro (у них уже есть 1M контекст) и попробуйте загрузить что-то объёмное. Поймите, где падает качество.
- Следите за API. Если стартап выпустит публичный API, подключайтесь первыми. Для этого важно, чтобы ваша инфраструктура была гибкой. ASI Biont поддерживает подключение к внешним API через гибкие интеграции — подробнее на asibiont.com.
Итог
Стартап из новости MIT Technology Review — не первый, кто обещал прорыв, но их подход выглядит технически обоснованным. Если они действительно решили проблему внимания на длинных контекстах, это снизит порог входа для многих бизнес-задач. Пока рано делать ставки, но игнорировать тренд нельзя. Я буду тестировать, как только появится доступ — и вам советую быть наготове.
Комментарии