Каждый день DS-специалисты тратят часы на однотипные задачи: почистить данные, построить график, подобрать гиперпараметры. А что если делегировать это нейросети? Я собрал 9 промтов, которые реально использую в работе. Они экономят мне 5–10 часов в неделю и делают код чище. Никакой магии — только проверенные формулировки и рабочие примеры.
1. Очистка данных: автопилот для грязных датасетов
Промт:
«Ты — опытный дата-инженер. Проанализируй датасет (CSV-файл) и напиши Python-скрипт для его очистки. Определи пропуски, дубликаты, выбросы (методом IQR) и некорректные типы данных. Для каждого столбца предложи стратегию: удалить, заполнить медианой/средним/модой, или преобразовать. Скрипт должен логировать каждое действие и выводить сводку до/после. Используй pandas и numpy.»
Пример: Я скормил этому промту датасет с 50 000 строк и 20 колонками. Через минуту получил скрипт, который автоматически нашел 12% пропусков, 3% дубликатов и 5 выбросов. Осталось только запустить — и чистый датасет готов. Экономия: 2 часа ручной работы.
Как это работает: Модель использует стандартные методы pandas (isnull(), duplicated(), describe()) и применяет правила из документации pandas. Важно указать «методом IQR» — иначе модель может выбрать менее надежный способ.
2. EDA: исследование, которое говорит само за себя
Промт:
«Проведи исследовательский анализ данных (EDA) для датасета [название]. Сгенерируй Python-код, который выводит: гистограммы распределения для числовых признаков, countplot для категориальных, матрицу корреляций с аннотациями и boxplot для выбросов. Для каждого графика добавь комментарий: что он показывает и какие гипотезы можно выдвинуть. Используй seaborn и matplotlib.»
Пример: Для датасета о клиентах банка промт выдал 15 графиков с готовыми выводами: «Признак balance имеет сильную корреляцию с возрастом (0.72) — возможно, стоит создать фичу age*balance». Я просто скопировал код в Jupyter и получил полноценный отчет.
Почему это эффективно: EDA — это 70% рутины. Нейросеть берет на себя визуализацию и первичную интерпретацию, а вы сосредотачиваетесь на проверке гипотез.
3. Фича-инжиниринг: генерация новых признаков
Промт:
«Для датасета [название] предложи 10 новых признаков, которые могут улучшить предсказательную способность модели. Для каждого признака напиши код на pandas и объясни, почему он полезен. Учитывай: [перечислите доменные ограничения]. Например, если есть даты — создай признаки „день недели“, „месяц“, „разница с текущей датой“.»
Пример: В задаче прогнозирования оттока клиентов промт предложил признаки: tenure_months_since_last_purchase, avg_transaction_amount_per_month, churn_risk_score = (1 - tenure/total_months) * activity_ratio. Модель XGBoost с этими фичами дала +5% к ROC-AUC (с 0.81 до 0.86).
Совет: Всегда указывайте доменную область — иначе модель предложит абстрактные признаки.
4. Визуализация: графики для презентаций за 10 минут
Промт:
«Создай Python-код для визуализации данных [датасет]. Нужно 3 графика: 1) динамика продаж по месяцам (lineplot с доверительным интервалом), 2) распределение по категориям (barplot с процентом), 3) heatmap корреляции. Оформи в едином стиле: цветовая палитра #4C72B0, белый фон, сетка. Сохрани в PNG с разрешением 200 dpi.»
Пример: Для отчетности перед стейкхолдерами я попросил график «продажи по регионам и кварталам». Нейросеть сгенерировала код с seaborn.FacetGrid, который создал аккуратную сетку из 12 графиков. Выглядело лучше, чем то, что я делал вручную.
5. Подбор гиперпараметров: быстрый GridSearch без боли
Промт:
«Напиши Python-код для подбора гиперпараметров модели RandomForestClassifier. Используй GridSearchCV с 5-фолдовой кросс-валидацией. Диапазоны: n_estimators [100, 200, 300], max_depth [None, 10, 20], min_samples_split [2, 5, 10]. Выведи лучшие параметры и среднее значение ROC-AUC. Добавь параллелизацию (n_jobs=-1).»
Пример: Вместо того чтобы вручную перебирать 27 комбинаций, промт сгенерировал код, который выполнился за 3 минуты на 8 ядрах. Лучшие параметры: max_depth=20, min_samples_split=2. Я сэкономил час.
Важно: Указывайте конкретные диапазоны, иначе модель может выбрать слишком широкие и вычисления займут вечность.
6. Оценка модели: метрики и интерпретация
Промт:
«Оцени качество бинарного классификатора. Даны y_true и y_pred. Напиши код для подсчета accuracy, precision, recall, F1, ROC-AUC. Построй ROC-кривую и confusion matrix. Добавь текстовый вывод: что означают метрики в контексте задачи и какие рекомендации можно дать (например, если precision выше recall — модель лучше подходит для задач, где важны ложноположительные срабатывания).»
Пример: Для модели детекции мошеннических транзакций промт выдал не только метрики, но и комментарий: «При пороге 0.7 precision=0.95, recall=0.85 — это оптимальный баланс, поскольку ложные срабатывания дороже пропусков». Я использовал этот вывод в отчете.
7. Интерпретация модели: SHAP для объяснения предсказаний
Промт:
«Используя библиотеку SHAP, объясни предсказания модели XGBoost для датасета [название]. Напиши код, который выводит: summary plot (bar и beeswarm), dependence plot для top-3 признаков, и текстовое объяснение, какие признаки влияют на предсказание и как. Добавь комментарии для нетехнической аудитории.»
Пример: Я объяснял менеджерам, почему модель отклоняет кредитные заявки. SHAP-графики показали, что главный фактор — соотношение долга к доходу. Промт сгенерировал код, который создал наглядные графики, и я смог рассказать историю без жаргона.
8. Автоматизация пайплайна: от сырых данных к предсказанию
Промт:
«Создай Python-скрипт, который автоматизирует полный ML-пайплайн: загрузка данных из CSV, очистка (пропуски, дубликаты), разделение на train/test, обучение RandomForest, оценка метрик, сохранение модели через joblib. Добавь обработку ошибок и логирование в файл pipeline.log. Скрипт должен запускаться из командной строки с аргументами --input, --output, --model.»
Пример: Этот промт помог мне создать скрипт, который я теперь запускаю каждую неделю для обновления модели на новых данных. Он сам загружает данные, обучает модель и отправляет отчет на почту. Экономия: 3 часа в неделю.
9. Деплой модели: REST API на FastAPI
Промт:
«Напиши код для FastAPI-приложения, которое принимает POST-запрос с JSON-данными (признаки), загружает сохраненную модель (joblib), делает предсказание и возвращает результат. Добавь валидацию входных данных через Pydantic, обработку ошибок, документацию Swagger. Код должен быть готов к запуску через uvicorn.»
Пример: Я использовал этот промт, чтобы обернуть модель в API для внутреннего сервиса. Через 15 минут у меня был работающий эндпоинт /predict, который принимал JSON и возвращал вероятность. Прод-команда была довольна.
Как выжать максимум из промтов
- Контекст решает всё. Чем больше деталей вы укажете (тип данных, домен, желаемый формат), тем точнее результат.
- Итеративность. Не ждите идеального кода с первого раза. Уточняйте: «добавь обработку выбросов», «используй другой алгоритм».
- Проверяйте код. Нейросеть может ошибиться в редких случаях. Всегда запускайте код в изолированном окружении.
- Комбинируйте промты. Например, промт №2 для EDA + промт №5 для подбора гиперпараметров дают полный цикл.
Эти 9 промтов закрывают 80% рутинных задач DS. Скопируйте их в свой инструментарий — и вы удивитесь, сколько времени освободится для настоящей аналитики. А если у вас есть свои проверенные промты — делитесь в комментариях!
Комментарии