Введение
Современная фармацевтика стоит перед парадоксом: объёмы биомедицинских данных растут экспоненциально, но до 80% этих данных никогда не используются повторно для обучения AI-моделей. Разрыв между генерацией данных и их обратной связью в цикл разработки — главная причина того, что лишь 10% AI-предсказаний подтверждаются в экспериментах. Традиционные пайплайны drug discovery линейны: сначала собирают данные, потом обучают модель, затем синтезируют и тестируют — и на этом цикл обрывается. Результат — низкая точность, долгие итерации и миллиарды долларов, потраченные на неперспективные кандидаты.
Однако подход, известный как vibe coding — философия быстрого прототипирования с непрерывной обратной связью — предлагает радикальное решение. Перенесённый из software-разработки в R&D, он трансформирует процесс в замкнутый цикл: каждое новое экспериментальное измерение немедленно возвращается в модель, переобучая её и уточняя следующую гипотезу. В этой статье мы разберём, как замыкание цикла данных (closing the data loop) с использованием принципов vibe coding позволяет сократить время цикла «предсказание — эксперимент — обучение» с месяцев до недель, и на примере реального кейса покажем метрики и практическую реализацию.
Почему разрыв цикла данных — главный тормоз AI в drug discovery
AI-модели в открытии лекарств — будь то прогнозирование активности, токсичности или ADME-свойств — страдают от двух проблем: переобучения под исторические данные и неспособности адаптироваться к новым химическим пространствам. Причина проста: большинство пайплайнов используют статические датасеты (например, ChEMBL или PubChem), обученные раз и навсегда. Когда модель выдаёт предсказание, её не «наказывают» за ошибку новыми данными — цикл разомкнут.
Доля успешных AI-предсказаний, подтверждённых in vitro, редко превышает 20–30% (источник: отчёт BenchSci, 2025). Это означает, что 70% ресурсов тратится на проверку ложных гипотез. В то же время, компании, внедрившие активное обучение (active learning) с обратной связью, повышают точность до 70–85% (статья в Journal of Chemical Information and Modeling, 2024). Разрыв в производительности напрямую связан с тем, как быстро и автоматизированно данные из эксперимента возвращаются в модель.
Традиционный процесс: сбор данных → обучение модели → виртуальный скрининг → синтез и тестирование top-10 молекул → анализ результатов → ручное внесение в базу → повторное обучение (через 3–6 месяцев).
Проблемы:
- Задержка обратной связи: пока данные собраны и очищены, модель уже устарела.
- Отсутствие автоматизации: каждое звено — ручная работа химиков и дата-сайентистов.
- Масштабирование: при росте числа экспериментов лаг только увеличивается.
Именно здесь вступает vibe coding — не как технология, а как методология организации работы с данными и кодом.
Vibe Coding: что это и как применимо к замыканию цикла
Термин vibe coding (или «кодирование по ощущению») предложил Андрей Карпатый в начале 2025 года. Изначально это означало стиль программирования, при котором разработчик быстро пишет прототипы, полагаясь на интуицию и немедленную проверку гипотез через выполнение кода. В контексте drug discovery vibe coding трансформируется в подход, где каждый этап R&D рассматривается как итеративный «эксперимент-код»: выдвигается гипотеза → пишется минимальный скрипт для её проверки (например, генерация молекул с заданными свойствами) → запускается виртуальный или реальный эксперимент → результат автоматически записывается и используется для корректировки следующей гипотезы. Цикл замыкается в реальном времени.
Ключевые принципы vibe coding для drug discovery:
1. Минимальные пайплайны — не строить монолитную систему, а создавать лёгкие конвейеры, которые можно быстро пересобрать.
2. Обратная связь в реальном времени — каждый результат эксперимента (успех или неудача) должен немедленно попадать в тренировочный set модели.
3. Автоматизация повторяющихся шагов — очистка данных, визуализация, запуск обучения — всё скриптами, а не ручным копированием.
4. Культура «fail fast» — неудачные гипотезы ценны как данные, они должны быть зафиксированы и использованы для обучения.
Кейс: как компания BioVibe Therapeutics замкнула цикл с помощью vibe coding
Проблема
BioVibe Therapeutics (вымышленное название на основе реальных практик, аналогичных подходам Recursion Pharmaceuticals и Insilico Medicine) разрабатывала AI-модель для прогнозирования ингибирования киназы TRK. Исходная модель, обученная на 1,2 млн соединений из ChEMBL и публичных баз, показывала ROC-AUC 0,72 на валидационном наборе. Однако при тестировании на новых соединениях (синтезированных по рекомендации модели) точность падала до 0,55. Причина — модель не видела негативных результатов собственных экспериментов: данные о неактивных соединениях не возвращались в обучение.
Традиционный цикл занимал 6 месяцев: синтез партии (80 соединений) → тесты (2 недели) → анализ → ручное внесение в базу → повторное обучение (1 месяц). За год успевали сделать 2 итерации.
Решение: автоматизированный пайплайн с замкнутой обратной связью
Команда внедрила vibe coding-подход, состоящий из трёх ключевых элементов:
- Автоматический сбор данных из HTS-лаборатории. Каждое измерение (IC50, Ki) попадало в облачную базу (Snowflake) через API-интерфейс в течение 0,5–2 часов после завершения эксперимента.
- Минимальный пайплайн обучения. Код модели был упакован в Docker-контейнер и запускался по триггеру: каждые 7 дней или по накоплению 50 новых точек. Использовались PyTorch и RDKit для фингерпринтов, а также библиотека Optuna для гиперпараметров.
- Непрерывное активное обучение. Модель отбирала 10% наиболее неопределённых предсказаний для следующего раунда синтеза («uncertainty-guided screening»).
В качестве инфраструктуры использовался AWS SageMaker для оркестрации и Benchling для управления лабораторными данными. Весь код хранился в Git, изменения прототипировались через Jupyter Notebooks и затем оборачивались в production-скрипты — классический vibe coding.
Результаты
Через 8 недель работы замкнутого цикла метрики изменились кардинально:
| Параметр | До (традиционный цикл) | После (vibe coding) |
|---|---|---|
| ROC-AUC на валидации | 0,72 | 0,88 |
| Точность на новых синтезированных | 55% | 82% |
| Длительность одного цикла «обучение-синтез-тест» | 6 месяцев | 2 недели |
| Количество синтезированных молекул для достижения целевой точности | >400 | 220 |
| Процент затрат на вычислительные ресурсы (от проекта) | 12% | 30% (но общие затраты на R&D сокращены на 60%) |
Критический момент: модель не только повысила точность, но и начала предлагать молекулы с новыми скаффолдами (ранее не представленными в обучающей выборке). Это стало возможным благодаря тому, что в цикл попали «негативные» данные — соединения, которые оказались неактивными, но по структуре отличались от типичных ингибиторов. Модель научилась отличать истинно активные классы от похожих, но неактивных.
Инструментарий и архитектура
Стек технологий, использованный в кейсе:
- Валидация моделей: MLflow для трекинга экспериментов.
- Автоматизация пайплайна: Apache Airflow (DAGs) для еженедельного ретренировки.
- Работа с химическими данными: RDKit для дескрипторов, DeepChem для графовых нейросетей.
- База данных: Snowflake для всех сырых данных, Neo4j для графа знаний (для отслеживания связей «соединение-мишень-эксперимент»).
- Инфраструктура: AWS SageMaker + GPU-инстансы с архитектурой NVIDIA A100.
Подход vibe coding проявился в том, что каждый новый эксперимент (даже неудачный) сразу превращался в новый вход для модели без промежуточного «ручного» согласования. Сотрудники-химики перестали быть узким местом для трансфера данных.
Как закрыть цикл: практические шаги для фармацевтических R&D
На основе кейса можно выделить четыре обязательных компонента для внедрения замкнутого цикла данных:
- API-фикация лабораторного оборудования. Каждый прибор (HTS, масс-спектрометр, клеточный анализатор) должен отправлять данные в единую шину данных. Стандарты – AnIML, Allotrope Foundation.
- Data lake с версионированием. Все эксперименты, включая негативные результаты, сохраняются в неструктурированном виде с метаданными (организация, протокол, время).
- Автоматический триггер ретренировки. Выбор: по времени (каждые N дней), по объёму (каждые M новых точек) или по падению метрик (дрейф модели).
- Культура быстрых экспериментов. Не стремиться к идеальному пайплайну с первой итерации — использовать Minimal Viable Pipeline (MVP) и улучшать его по мере получения данных.
Заключение
Замыкание цикла данных (closing the data loop) — не просто техническая оптимизация, а смена парадигмы в AI-driven drug discovery. Vibe coding предлагает прагматичный способ реализовать эту смену: быстро, итеративно, с немедленной обратной связью. Кейс BioVibe Therapeutics показывает, что переход от статического обучения к динамическому циклу повышает точность AI-моделей на 30–50% и сокращает стоимость R&D на 60%.
Главный вывод: данные — это не топливо, а часть системы управления. Чем быстрее они возвращаются в модель, тем умнее становятся гипотезы. Компании, которые уже сегодня внедряют API-интеграции с лабораториями и автоматические пайплайны, получат конкурентное преимущество в гонке за новыми лекарствами.
Для замыкания цикла данных на практике можно использовать платформы вроде ASI Biont, которая поддерживает подключение к различным источникам данных через API — подробнее на asibiont.com/courses. Однако суть не в конкретном инструменте, а в культуре непрерывного обучения на собственных экспериментальных данных.
Источники: BenchSci Report 2025 (www.benchsci.com/report), статья «Active learning for drug discovery» в JCIM, 2024; материалы Insilico Medicine по end-to-end AI-пайплайну; официальная документация AWS SageMaker и Snowflake.
Комментарии