Потолок пробит: как один стартап обещает снять главное ограничение больших языковых моделей

Я последние несколько лет работаю с LLM в реальных бизнес-процессах — автоматизация клиентской поддержки, генерация контента, анализ данных. И каждый раз упираюсь в одну и ту же стену: модели либо слишком дороги в развертывании, либо слишком медленны, либо их память и контекстное окно не позволяют обрабатывать длинные цепочки рассуждений. В июне 2026 года появилась новость, которая может изменить правила игры. Источник

Речь о стартапе, который заявляет, что решил проблему, десятилетиями тормозившую развитие языковых моделей. Речь не про очередное увеличение количества параметров — это про то, как сделать модели доступными для реального применения без космических затрат. Давайте разберемся, что именно они придумали и почему это может стать (а может и не стать) прорывом.

Что это за bottleneck и почему он всех бесит

Любой, кто плотно работал с LLM (GPT-4, Claude, Gemini последней версии), знает: главная проблема не в том, что модель плохо генерирует текст. Проблема в том, что она потребляет чудовищные ресурсы. Каждый запрос — это дорого. Каждый миллион токенов — это сотни долларов. А если нужно сделать модель умнее на ваших данных (fine-tuning), то это вообще отдельная история с дата-центрами.

Но есть и другая сторона — так называемый «контекстный bottleneck». Модели с трудом удерживают длинные контексты. Окна в 128K токенов уже есть, но качество работы на длинном контексте резко падает. Стартап, о котором идет речь, утверждает, что обошел это ограничение на архитектурном уровне.

Что конкретно сделал стартап

По данным MIT Technology Review, команда разработала новый метод обучения и инференса, который позволяет модели обрабатывать последовательности длиной до 10 миллионов токенов без потери качества. Для сравнения: текущий стандарт — 128K–1M токенов. Это не просто цифры — это возможность анализировать всю документацию компании, код репозитория или переписку за год в одном запросе.

Технически они модифицировали механизм внимания (attention). Вместо того чтобы на каждом шаге пересчитывать все связи между токенами (что даёт сложность O(n²)), они ввели разреженное внимание с динамическим выделением релевантных участков. Это снижает вычислительную сложность до O(n log n). На практике это означает, что модель может работать с длинными документами, не замедляясь экспоненциально.

Сравнение с текущими подходами

Параметр Текущие LLM (GPT-4, Claude 3.5) Новая технология стартапа
Максимальная длина контекста 128K–1M токенов До 10M токенов
Сложность инференса O(n²) O(n log n)
Качество на длинных контекстах Падает после 50K Заявлено стабильное
Стоимость за 1M токенов $10–30 (API) Заявлено <$1
Доступность Широко, через API Только в закрытом бета-тесте

Цифры выглядят многообещающе, но пока это заявления. Насколько они соответствуют реальности — увидим после публичных релизов.

Как это может изменить бизнес-применение LLM

Я вижу несколько сценариев, где это может быть прорывом:

  1. Юридический анализ. Представьте, что вы можете загрузить весь договорной архив компании (сотни тысяч страниц) и задать один вопрос: «Найди все пункты, где мы рискуем штрафами». Сейчас это требует разбивки на тысячи запросов.
  2. Код-ревью. Разработчики смогут анализировать целые репозитории как единый контекст, а не только отдельные файлы.
  3. Медицина. Анализ полной истории болезни пациента за 20 лет — сейчас это невозможно из-за ограничений по длине.

Но есть и обратная сторона: чем длиннее контекст, тем больше вероятность, что модель «забудет» важные детали в середине. Даже если сложность снижена, проблема «потери внимания» остаётся. Стартап утверждает, что решил и это, но я бы подождал независимых тестов.

Что говорят скептики

Не все в восторге. Некоторые эксперты указывают, что разреженное внимание — известная идея (например, в моделях типа Longformer). Проблема в том, что на коротких контекстах разреженное внимание часто работает хуже полного. Стартап, вероятно, нашёл способ переключаться между режимами, но деталей пока мало.

Другой риск — стоимость. Если они действительно снизили цену до <$1 за 1M токенов, это может обрушить рынок API-провайдеров. Но такие заявления мы слышали и раньше — вспомните «вечный двигатель» стартапов по дешевому ИИ.

Мой прогноз

Я оптимист. Даже если заявленные цифры завышены в 2–3 раза, это всё равно прогресс. Для моего бизнеса — автоматизация обработки договоров и отчетов — контекст в 1M токенов уже решит 90% задач. Если же они действительно выйдут на 10M, это изменит подход к построению AI-агентов.

Пока я планирую следить за бета-тестом и, если появится доступ, протестировать на своих данных. Главное — не поддаваться хайпу, а ждать объективных бенчмарков.

Как подготовиться к изменениям уже сейчас

Даже если технология стартапа не взлетит, тренд на удлинение контекста очевиден. Через год-два все крупные игроки предложат контексты от 1M токенов. Что делать бизнесу:

  • Пересмотрите архитектуру хранения данных. Если вы храните документы в виде мелких фрагментов, это может стать узким местом. Готовьтесь к тому, что модели смогут «читать» целиком.
  • Тестируйте длинные запросы уже сейчас. Возьмите Claude 3.5 или Gemini 1.5 Pro (у них уже есть 1M контекст) и попробуйте загрузить что-то объёмное. Поймите, где падает качество.
  • Следите за API. Если стартап выпустит публичный API, подключайтесь первыми. Для этого важно, чтобы ваша инфраструктура была гибкой. ASI Biont поддерживает подключение к внешним API через гибкие интеграции — подробнее на asibiont.com.

Итог

Стартап из новости MIT Technology Review — не первый, кто обещал прорыв, но их подход выглядит технически обоснованным. Если они действительно решили проблему внимания на длинных контекстах, это снизит порог входа для многих бизнес-задач. Пока рано делать ставки, но игнорировать тренд нельзя. Я буду тестировать, как только появится доступ — и вам советую быть наготове.

← Все статьи

Комментарии

Читайте также

Cambridge Lower Secondary Global Perspectives (1129): курс, который учит думать, а не запоминать

8 августа 2026

Интеграция HelpScout: автоматизация ИИ-поддержки клиентов с помощью ASI Biont (без кода)

8 августа 2026

Курс по мультимодальному ИИ: освойте GPT-4V, CLIP, Whisper и Stable Diffusion

8 августа 2026

Speaker / buzzer + AI: как подключить динамик и зуммер к ASI Biont через чат — гайд для IoT-разработчиков

8 августа 2026

Создание RAG-систем: курс по RAG, который подготовит вас к рынку ИИ 2026 года

8 августа 2026

AWS Solutions Architect Professional (SAP-C02): как стать архитектором облачных решений с ИИ-обучением

8 августа 2026

CISO Executive Program — Chief Information Security Officer: путь к роли бизнес-лидера в информационной безопасности

8 августа 2026

Курс по мобильной разработке 2026: Освойте Flutter, React Native и обучение с ИИ для прибыльной карьеры

8 августа 2026

Трудовое право Российской Федерации: почему обучение с ИИ на Asibiont — самый эффективный способ освоить его в 2026 году

8 августа 2026