Data Science 2026: 12 промтов, которые заменят половину рутины

2026 год. Data Science окончательно перестал быть «наукой о данных» и стал инженерной дисциплиной. Модели обучаются быстрее, данные стали больше, а требования к скорости итераций — жёстче. Но есть одна вещь, которая не изменилась: 60–70% времени специалиста по-прежнему уходит на рутину — очистку данных, подбор гиперпараметров, оформление отчётов. Именно здесь LLM становятся незаменимыми. Я собрал 12 проверенных промтов, которые реально экономят часы каждую неделю. Они покрывают весь цикл: от первичного анализа до продакшена и визуализации. Никакой воды — только то, что работает.

Промт 1. Разведка данных (EDA) за минуту

Когда использовать: Вы получили новый датасет и нужно быстро понять его структуру, пропуски, распределения и корреляции.

Промт: «Ты — опытный data scientist. Проведи разведочный анализ данных для датасета, который я загружу. Сгенерируй Python-код с использованием pandas, matplotlib и seaborn, который: 1) выведет первые 5 строк и info() для понимания типов; 2) посчитает долю пропусков по каждому столбцу; 3) построит гистограммы для числовых признаков и countplot для категориальных; 4) покажет матрицу корреляций. Используй подписи на русском. Код должен быть готов к запуску в Jupyter Notebook.»

Пример: Загружаете CSV с данными о клиентах банка. Промт генерирует код, который сразу выявляет: 30% пропусков в колонке «Зарплата», сильную корреляцию между «Возрастом» и «Просрочкой». Это позволяет быстро решить, какие признаки чистить, а какие — исключить.

Промт 2. Автоматическая очистка данных

Когда использовать: Данные грязные: дубликаты, выбросы, несоответствия типов.

Промт: «Напиши функцию clean_data(df) на Python, которая: удаляет дубликаты (кроме строк с уникальными ID), обрабатывает пропуски (числовые — медианой, категориальные — модой), отлавливает выбросы методом IQR и заменяет их на границы, приводит все строки к нижнему регистру и убирает пробелы. Добавь docstring и пример использования.»

Пример: В датасете о продажах 2000 дубликатов и 15% пропусков в колонке «Количество». Функция справляется за секунды, а не за полчаса ручной работы.

Промт 3. Генерация синтетических данных

Когда использовать: Не хватает данных для обучения, особенно для редких классов.

Промт: «Сгенерируй синтетический датасет на основе распределений исходного (я его приложу). Используй библиотеку ydata-synthetic или scikit-learn make_classification. Сохрани соотношение классов, корреляции между признаками и диапазоны значений. Выведи размер и примеры строк.»

Пример: Для модели обнаружения мошенничества редкий класс — 0,1%. Синтетика увеличивает его до 10%, модель перестаёт предсказывать только «не мошенник».

Промт 4. Подбор гиперпараметров

Когда использовать: Нужно быстро найти лучшие параметры для градиентного бустинга или случайного леса.

Промт: «Для модели XGBoost (классификация, метрика ROC-AUC) напиши код для Optuna. Перебери параметры: n_estimators (50–500), max_depth (3–10), learning_rate (0.01–0.3), subsample (0.5–1.0), colsample_bytree (0.5–1.0). Используй 5-фолдовую кросс-валидацию, 50 trials. Выведи лучшие параметры и метрику.»

Пример: Вместо ручного перебора 100 комбинаций Optuna находит оптимум за 50 итераций, экономя 3–4 часа.

Промт 5. Объяснение модели (SHAP)

Когда использовать: Нужно понять, какие признаки влияют на предсказание.

Промт: «Построй SHAP-анализ для обученной модели XGBoost. Сгенерируй код: 1) вычисление SHAP-значений для тестовой выборки; 2) summary plot; 3) bar plot топ-10 признаков; 4) водопад для одного наблюдения. Подписи на русском, сохрани графики в файлы.»

Пример: Банк хочет объяснить клиенту, почему отказано в кредите. SHAP показывает, что решающим стал возраст и доход — это можно использовать в коммуникации.

Промт 6. Автоматическое создание отчёта

Когда использовать: После обучения нужно оформить результаты для стейкхолдеров.

Промт: «Сгенерируй Markdown-отчёт о результатах эксперимента. Включи: метрики (точность, recall, F1, ROC-AUC), сравнение с бейзлайном, матрицу ошибок, выводы о качестве модели и рекомендации по улучшению. Используй таблицы для сравнения.»

Пример: Отчёт сразу готов для вставки в Confluence или презентацию — не нужно переписывать из ноутбука.

Промт 7. SQL-запросы для аналитики

Когда использовать: Нужно выгрузить данные из БД в нужном разрезе.

Промт: «Напиши SQL-запрос для PostgreSQL: выведи количество продаж по месяцам за 2025 год, с разбивкой по категориям товаров. Используй оконную функцию для скользящего среднего за 3 месяца. Добавь комментарии к каждой части.»

Пример: Аналитик получает готовый запрос, который раньше писал бы 20 минут.

Промт 8. Визуализация в стиле Tufte

Когда использовать: Нужны графики для отчёта или статьи, которые выглядят профессионально.

Промт: «Создай код на matplotlib/seaborn для линейного графика с доверительным интервалом. Оформи в стиле Эдварда Тафти: убери лишние линии сетки, используй сдержанные цвета, добавь подписи данных и аннотации. Сохрани в SVG с высоким DPI.»

Пример: График динамики цен на нефть с интервалами выглядит как из The Economist — приятно смотреть и легко читать.

Промт 9. Обёртка для FastAPI

Когда использовать: Модель обучена, нужно вывести её в продакшен.

Промт: «Напиши FastAPI-приложение для serving модели (файл model.pkl). Эндпоинт /predict принимает JSON с признаками и возвращает предсказание. Добавь валидацию через Pydantic, обработку ошибок, логирование. Приложи пример запроса через curl.»

Пример: Модель готова к интеграции за 10 минут — сервис отвечает на POST-запросы.

Промт 10. Конвейер на Airflow

Когда использовать: Нужно автоматизировать переобучение модели по расписанию.

Промт: «Создай DAG для Airflow: каждый понедельник в 6 утра запускает задачу извлечения данных из S3, обучения модели и сохранения метрик в PostgreSQL. Используй PythonOperator, добавь retries и оповещение в Slack при ошибке.»

Пример: Модель переобучается без участия человека каждую неделю, а при сбое — приходит уведомление.

Промт 11. A/B-тестирование

Когда использовать: Нужно спланировать и проанализировать A/B-тест.

Промт: «Спланируй A/B-тест для изменения алгоритма рекомендаций. Рассчитай минимальный размер выборки (alpha=0.05, power=0.8, MDE=1%). Напиши код на Python для проверки значимости (t-test для метрики конверсии) и построй доверительные интервалы.»

Пример: Аналитик получает готовый план и код — не нужно вспоминать статистику.

Промт 12. Документация проекта

Когда использовать: Код есть, а документации нет.

Промт: «Создай README.md для репозитория с ML-проектом: опиши структуру, установку зависимостей (pip install -r requirements.txt), запуск обучения (python train.py) и API. Добавь раздел с примерами использования.»

Пример: Новый разработчик в команде понимает проект за 15 минут, а не разбирается в коде часами.

Итоги

Эти промты не заменяют экспертизу — они освобождают время для того, что действительно важно: понимания бизнес-задачи и принятия решений. В 2026 году data scientist, который не использует LLM в рутине, проигрывает в скорости в 5–10 раз. Начните с трёх промтов, которые закроют ваши самые частые задачи, и расширяйте арсенал по мере привыкания. А если у вас есть свои проверенные промты — делитесь в комментариях, давайте соберём базу лучших практик.

← Все статьи

Комментарии

Читайте также