От сырых данных до ML-модели: 14 промтов, которые заменят половину работы дата-сайентиста

Вы когда-нибудь тратили часы на очистку данных, чтобы потом обнаружить, что в столбце с датами перемешаны форматы? Или писали длинный код для визуализации, хотя нейросеть могла бы сделать это за минуту? Я — да, и именно поэтому я собрал коллекцию из 14 промтов, которые покрывают весь цикл Data Science: от первичного анализа до интерпретации моделей. Эти шаблоны я проверил на реальных задачах — от обработки логов веб-сервера до прогнозирования оттока клиентов. Они экономят часы работы и помогают избегать типичных ошибок. Ниже — готовая шпаргалка, которую можно копировать и адаптировать под свои данные.

1. Универсальный исследовательский анализ (EDA) за один промт

Когда использовать: Вы получили новый датасет и хотите быстро понять его структуру, пропуски, распределения и корреляции, не написав ни строчки кода.

Промт:

Проведи исследовательский анализ данных (EDA) для датасета {название}. Опиши:
- Размер и типы данных (числовые, категориальные, временные ряды).
- Долю пропущенных значений в каждом столбце.
- Основные статистики (среднее, медиана, стандартное отклонение) для числовых признаков.
- Гистограммы распределения для каждого числового признака.
- Матрицу корреляции Пирсона.
- Выбросы (методом IQR или Z-score).
- Инсайты: какие признаки выглядят наиболее важными, есть ли аномалии.
Используй Python (pandas, seaborn, matplotlib). Код должен быть готов к запуску.

Пример использования: Вы загрузили данные о продажах интернет-магазина. Промт выдаст код, который построит все графики, и текстовое резюме: «Признаки "количество товаров" и "сумма заказа" сильно коррелируют (r=0.85), что ожидаемо. Пропусков почти нет, но в столбце "возраст" есть выбросы — возможно, ошибки ввода».

Почему это работает: Модель выполняет роль аналитика, который знает стандартные шаги EDA. Вы получаете не просто код, а интерпретацию — это ключевое отличие от простого скрипта.

2. Очистка данных от дубликатов и пропусков

Когда использовать: Перед построением модели нужно привести данные в порядок: убрать дубли, заполнить пропуски, нормализовать.

Промт:

Помоги очистить датасет {название}. Напиши Python-код, который:
- Удалит дубликаты на основе всех столбцов.
- Заполнит пропуски в числовых признаках медианой, в категориальных — модой.
- Нормализует числовые признаки методом MinMaxScaler.
- Закодирует категориальные переменные с помощью OneHotEncoder.
- Выведет количество строк и столбцов до и после очистки.
Объясни каждый шаг комментариями в коде.

Пример: После выполнения вы увидите: «Было 10 000 строк, удалено 150 дубликатов, заполнено 300 пропусков». Это стандартная предобработка, которую нейросеть делает без ошибок.

3. Генерация синтетических данных для тестов

Когда использовать: Нужно проверить алгоритм на больших данных, но реальных данных мало или они конфиденциальны.

Промт:

Сгенерируй синтетический датасет для задачи регрессии: 10 000 строк, 5 признаков (2 числовых, 2 категориальных, 1 бинарный). Целевая переменная должна быть связана с признаками линейно с добавлением шума. Используй numpy и pandas. Выведи первые 5 строк и описание.

Пример: Вы разрабатываете пайплайн и не хотите использовать реальные данные. Промт создаст датасет с реалистичными распределениями — например, возраст от 18 до 80, доход от 20k до 200k.

4. Построение модели классификации с оценкой метрик

Когда использовать: Нужно обучить модель и получить метрики: accuracy, precision, recall, F1, ROC-AUC.

Промт:

Обучи модель классификации на датасете {название}. Целевая переменная — {target}. Выполни:
- Раздели данные на train/test (80/20) со стратификацией.
- Обучи логистическую регрессию и RandomForest.
- Выведи classification_report для обеих моделей.
- Построй ROC-кривые и посчитай AUC.
- Сравни модели и сделай вывод, какая лучше и почему.

Пример: Для задачи определения мошеннических транзакций вы получите отчет с precision/recall для каждого класса. Важно: промт просит сравнение, а не просто код — это помогает принять решение.

5. Автоматический подбор гиперпараметров

Когда использовать: Модель обучена, но вы хотите улучшить метрики, перебирая гиперпараметры.

Промт:

Подбери гиперпараметры для RandomForest на датасете {название}. Используй GridSearchCV или RandomizedSearchCV. Диапазоны: n_estimators от 50 до 300, max_depth от 5 до 20, min_samples_split от 2 до 10. Метрика — accuracy. Выведи лучшие параметры и score на валидации. Покажи время выполнения.

Пример: Вы узнаете, что оптимальные параметры — n_estimators=200, max_depth=15, точность выросла с 0.82 до 0.87. Это избавляет от ручного перебора.

6. Интерпретация модели с помощью SHAP

Когда использовать: Нужно объяснить, почему модель приняла то или иное решение. Это критично для банков, медицины и других регуляторных областей.

Промт:

Объясни предсказания модели {модель} на тестовых данных с помощью библиотеки SHAP. Построй:
- summary plot (глобальная важность признаков).
- waterfall plot для конкретного наблюдения (например, для клиента с наибольшим предсказанным значением).
- Интерпретируй графики: какие признаки сильнее всего влияют на результат.

Пример: Для модели кредитного скоринга SHAP покажет, что «количество просрочек» — главный фактор отказа. Это позволяет обосновать решение перед клиентом.

7. Визуализация данных для презентации

Когда использовать: Нужно создать профессиональные графики для отчета или презентации.

Промт:

Создай визуализацию для датасета {название}: 2-3 графика, которые лучше всего показывают ключевые тренды. Используй seaborn или plotly. Для каждого графика добавь заголовок, подписи осей, легенду. Выбери цветовую палитру, подходящую для людей с дальтонизмом. Выведи код и опиши, что показывает каждый график.

Пример: Вы получите код для heatmap корреляций и barplot по категориям. Графики будут готовы для вставки в слайды.

8. Прогнозирование временных рядов

Когда использовать: У вас есть данные с датами (продажи, трафик) и нужно предсказать будущее.

Промт:

Построй прогноз временного ряда {данные} на 30 шагов вперед. Используй модель ARIMA или Prophet. Выведи:
- График исторических данных и прогноза с доверительным интервалом.
- Метрики ошибки: MAE, RMSE на тестовой выборке.
- Интерпретацию: есть ли сезонность, тренд.

Пример: Для данных о продажах вы увидите прогноз на месяц вперед с доверительными границами. Это помогает планировать закупки.

9. Кластеризация клиентов для сегментации

Когда использовать: Нужно разделить клиентов на группы для маркетинговых кампаний.

Промт:

Проведи кластеризацию клиентов на основе признаков {features}. Используй K-means. Определи оптимальное число кластеров методом локтя (elbow method). Визуализируй кластеры на PCA-проекции. Опиши профиль каждого кластера (средние значения признаков).

Пример: Вы получите 3 кластера: «молодые с низким доходом», «средний возраст со средним доходом», «обеспеченные». Это основа для таргетинга.

10. Обработка несбалансированных классов

Когда использовать: Целевая переменная сильно смещена (например, 1% положительных случаев).

Промт:

В датасете {название} целевая переменная несбалансирована (доля положительного класса = {доля}). Предложи и реализуй методы борьбы: SMOTE, class_weight, ансамбли. Сравни метрики (precision, recall, F1) до и после применения. Выведи classification_report.

Пример: Для детекции мошенничества recall вырастет с 0.2 до 0.7 без сильной потери precision. Это критически важно для бизнеса.

11. Генерация кода для дата-пайплайнов

Когда использовать: Нужно регулярно пересобирать данные из нескольких источников.

Промт:

Напиши Python-скрипт для ETL-процесса: читай данные из CSV, SQL-базы и API (например, {ссылка}), объединяй их, очищай, сохраняй в Parquet. Добавь логирование и обработку ошибок. Скрипт должен быть модульным и с docstring.

Пример: Вы получите готовый скрипт, который можно запускать по расписанию через cron. Это экономит часы ручной работы.

12. Проверка гипотез с помощью статистических тестов

Когда использовать: Нужно понять, значимо ли различаются группы (например, A/B-тест).

Промт:

Проведи статистический тест для сравнения двух групп: {группа A} и {группа B}. Выбери подходящий тест (t-test, Манна-Уитни, хи-квадрат) в зависимости от типа данных. Выведи p-value и интерпретацию: отвергается ли нулевая гипотеза на уровне 0.05. Добавь эффект размера (Cohen's d).

Пример: Для A/B-теста конверсии вы получите p-value = 0.03 — результат значим, можно запускать изменение.

13. Создание дашборда в Plotly Dash

Когда использовать: Нужно визуализировать данные для коллег или клиентов в интерактивном формате.

Промт:

Создай интерактивный дашборд на Plotly Dash для датасета {название}. Включи:
- Фильтры по категориальным признакам.
- Основные метрики (карточки).
- Графики: временной ряд, barplot, scatter plot.
- Оформи в современном стиле (тёмная тема).

Пример: Вы получите код приложения, которое можно запустить локально и поделиться ссылкой. Это впечатляет на демо.

14. Объяснение сложных концепций простыми словами

Когда использовать: Нужно объяснить модель или алгоритм стейкхолдерам без технического бэкграунда.

Промт:

Объясни, как работает {алгоритм, например, градиентный бустинг}, простыми словами, используя аналогии из жизни. Приведи пример из бизнеса. Избегай формул. Цель — чтобы человек без технического образования понял.

Пример: «Градиентный бустинг похож на команду слабых учеников, которые вместе сдают экзамен: каждый исправляет ошибки предыдущего». Это помогает в коммуникации.

15. Генерация отчета по результатам анализа

Когда использовать: Нужно оформить результаты анализа в структурированный документ.

Промт:

Составь отчет по результатам анализа датасета {название}. Включи: цель, данные, методы, основные результаты (с цифрами), ограничения, рекомендации для бизнеса. Используй профессиональный стиль и Markdown-форматирование. Раздели на секции.

Пример: Вы получите готовый текст для внутренней вики или письма заказчику. Экономит время на написание.

16. Обучение модели с автоматическим логированием

Когда использовать: Нужно отслеживать эксперименты (метрики, параметры) — особенно в команде.

Промт:

Обучи модель с использованием MLflow: логируй параметры, метрики, model artifact. Выведи команды для запуска MLflow UI. Сделай код устойчивым к ошибкам.

Пример: Вы сможете сравнивать эксперименты в веб-интерфейсе, что важно для воспроизводимости.

17. Деплой модели как REST API

Когда использовать: Модель готова, и нужно сделать её доступной для других сервисов.

Промт:

Напиши FastAPI-приложение для модели {модель}: загрузи модель из файла, создай endpoint /predict, который принимает JSON с признаками и возвращает предсказание. Добавь валидацию входных данных и обработку ошибок. Укажи команду для запуска uvicorn.

Пример: Вы получите работающий API, который можно протестировать через Swagger UI.

Практический пример: полный цикл

Представьте, что вы работаете с датасетом об оттоке клиентов телеком-компании. С помощью промтов №1, 2, 4, 6, 15 вы: проводите EDA, очищаете данные, строите модель, интерпретируете с SHAP и генерируете отчет. Весь процесс занимает около часа вместо дня. Именно так нейросети ускоряют работу дата-сайентиста.

Что дальше?

Эти промты — не догма, а отправная точка. Адаптируйте их под свои данные и задачи: добавляйте детали, меняйте модели, уточняйте форматы. Главное — всегда проверяйте результаты: нейросеть может ошибаться, особенно в новых библиотеках. Используйте эти шаблоны как ассистента, а не как замену экспертизе. И помните: лучший промт — тот, который уточняет контекст. Удачи в экспериментах!

← Все статьи

Комментарии