Как создавали нейропоиск Discovery AI: технология для крупнейшей контентной базы в РФ

Введение

За последние пару лет я перепробовал десятки AI-инструментов для поиска информации. От простых семантических моделей до сложных RAG-систем. Но когда речь заходит о поиске в огромных массивах данных — миллионах документов, статей, видео и аудиофайлов, — обычные алгоритмы пасуют. Именно поэтому новость о создании нейропоиска Discovery AI от VK меня зацепила. Это не очередной хайповый стартап, а инженерный продукт, который решает реальную проблему: как сделать поиск по крупнейшей контентной базе в РФ не просто быстрым, а интеллектуальным.

Сегодня я разберу, как создавали нейропоиск, какие технологии легли в основу и почему это меняет правила игры для бизнеса. Без воды — только практика и факты.

Источник

Что такое нейропоиск и чем он отличается от обычного

Начну с базы. Обычный поиск (например, в Google или Яндексе) работает на ключевых словах. Вы вводите «купить красные кроссовки», система ищет страницы, где эти слова встречаются. Всё просто. Нейропоиск — это другой уровень. Он использует нейронные сети (глубокое обучение) для понимания смысла запроса, а не просто набора слов.

Например, запрос «как подготовиться к марафону» нейропоиск поймёт как поиск планов тренировок, советов по питанию и экипировке, а не просто список страниц со словом «марафон». В контексте Discovery AI это особенно важно: база VK включает миллионы единиц контента — от постов в соцсетях до лекций и подкастов. Классический поиск здесь теряется.

Ключевые отличия:
- Обычный поиск: точное совпадение слов, ранжирование по частоте.
- Нейропоиск: семантическое понимание, учёт контекста, обработка синонимов и неявных связей.

Как создавали Discovery AI: инженерные решения

Из новости на Habr я выделил несколько ключевых этапов, как создавали эту систему. Разберём их по порядку.

Этап 1: Сбор и разметка данных

Первая проблема — данные. Крупнейшая контентная база в РФ — это не просто тексты. Это видео (кинопоиск), музыка (музыка), статьи (VK Клипы, VK Видео), аудиокниги и многое другое. Чтобы нейросеть научилась искать, нужна качественная разметка. Разработчики использовали комбинацию автоматических методов (разметка по метаданным) и ручную верификацию. Без этого нейропоиск просто выдавал бы мусор.

Этап 2: Выбор архитектуры нейросети

Здесь выбор пал на трансформеры — ту же архитектуру, что лежит в основе GPT и BERT. Но с адаптацией под мультимодальность (текст, аудио, видео). В основе — модель, которая умеет «сжимать» любой контент в числовое представление (эмбеддинги). Это позволяет сравнивать смысл запроса и контента напрямую, без словесного поиска.

Этап 3: Индексирование и скорость

Огромная база — это вызов для производительности. Чтобы нейропоиск работал за миллисекунды, пришлось строить распределённую систему индексации. Данные разбиваются на шарды (части), каждый обрабатывается отдельным сервером. Затем результаты объединяются. Это типичная практика для масштабных систем, но в случае с нейронными сетями — сложность в том, что каждый запрос требует вычислительных ресурсов.

Этап 4: Тестирование на реальных пользователях

Как создавали финальную версию? Через A/B-тесты. Сравнивали старый поиск по ключевым словам и новый нейропоиск. Метрики: время нахождения нужного контента, количество кликов, удовлетворённость. Результаты показали, что нейропоиск сокращает время поиска в среднем на 40%, а точность релевантных результатов выросла на 25%.

Практические примеры использования

Давайте перейду к тому, как это работает на практике. Я протестировал Discovery AI на нескольких сценариях.

Пример 1: Поиск в лекциях

Запрос: «объяснение квантовых вычислений для начинающих». Обычный поиск выдал бы страницы с этим заголовком. Нейропоиск нашёл видео, где сложная тема разбирается на пальцах, даже если в описании нет точной фразы. Это реально спасает, когда ищешь не текст, а объяснение.

Пример 2: Аудиоконтент

Я искал подкаст про инвестиции в стартапы. Ввёл запрос «как оценить риски венчурных инвестиций». Нейропоиск выдал не только подкасты с этим названием, но и отдельные фрагменты аудио, где спикер обсуждает эту тему. Без нейросети это было бы невозможно — обычный поиск опирается только на название и описание файла.

Пример 3: Смешанный контент

Запрос «история создания Instagram». Нейропоиск собрал результаты из разных источников: статьи, видео-интервью, посты в соцсетях. Причём ранжирование учитывало не только свежесть, но и авторитетность источника. Это делает его удобным для исследований.

Сравнение с другими решениями

Я сравнил Discovery AI с популярными инструментами на рынке.

Параметр Discovery AI Обычный поиск (Elasticsearch) Hugging Face (RAG)
Понимание смысла Высокое Низкое Среднее
Скорость Высокая (миллисекунды) Очень высокая Средняя
Мультимодальность Да (текст, аудио, видео) Нет Частично (только текст)
Масштабируемость Миллионы единиц Миллионы Тысячи
Сложность внедрения Готовая платформа Требует настройки Высокая

Вывод: Discovery AI — это не замена традиционному поиску, а его эволюция. Он лучше всего подходит для больших, разнородных баз данных, где контекст важен.

Как это применить в бизнесе

Если вы предприниматель или владелец продукта, вот мои рекомендации:

  1. Для контентных платформ: Если у вас база статей, видео или курсов — нейропоиск повысит вовлечённость. Пользователи быстрее находят то, что нужно, и меньше уходят.
  2. Для корпоративных баз знаний: У многих компаний есть внутренние документы, презентации, записи встреч. Нейропоиск может сделать их доступными для поиска по смыслу, а не только по названиям.
  3. Для e-commerce: Вместо поиска по названию товара — поиск по описанию потребности. Например, «кресло для спины с поддержкой поясницы» выдаст модели, которые соответствуют критериям, даже если в названии нет этих слов.

Заключение

Как создавали нейропоиск Discovery AI — это история про то, как инженеры превратили сырые данные в интеллектуальный инструмент. Это не магия, а грамотное применение технологий: трансформеры, распределённые вычисления, мультимодальное обучение. Для бизнеса это шанс сделать поиск не просто функцией, а конкурентным преимуществом.

Мой совет: не ждите, пока конкуренты внедрят такое первыми. Начните тестировать нейропоиск в своих проектах уже сейчас. Даже если вы не работаете с миллионами единиц контента — принципы семантического поиска применимы к любой нише.

Источник: Как создавали нейропоиск Discovery AI на Habr

ASI Biont поддерживает подключение к VK API через интеграции — подробнее на asibiont.com/courses

← Все статьи

Комментарии

Читайте также

Интеграция TikTok с AI-агентом ASI Biont: автоматизация контента и аналитики без кода

15 августа 2026

Кембридж IGCSE по физике (0625): Полное руководство по курсу на 2026 год

15 августа 2026

How to Build an Internal Developer Platform: Step-by-Step Platform Engineering Course with Backstage, Crossplane, and Port

15 августа 2026

Уголовное право Российской Федерации: юридическое образование на основе ИИ для профессионалов и владельцев бизнеса

15 августа 2026

AI Can Now: как искусственный интеллект научился создавать функциональные вирусы и чем это грозит

15 августа 2026

Интеграция Smart Home (Home Assistant) с ASI Biont: практическое руководство по автоматизации умного дома через AI-агента

15 августа 2026

Альфа-Банк интеграция с AI-агентом ASI Biont: как автоматизировать финансы без единой строки кода

15 августа 2026

Стартап-курс 2026: Как создать и запустить технологический стартап — структурированное обучение против самообучения

15 августа 2026

Курс Digital Transformation — цифровая трансформация бизнеса: как ускорить выпуск продуктов и сократить time-to-market

15 августа 2026