От CSV до дашборда: 12 промтов, которые заменят мне джуна по данным
Каждый день я работаю с данными: то pandas, то SQL, то визуализация. И знаете, что? 80% рутины можно отдать нейросети, если правильно составить промт. Я собрал 12 проверенных промтов, которые реально ускоряют мою работу — от очистки данных до интерпретации моделей. Никакой воды, только код и примеры.
1. Чистка данных без боли: промт для pandas
Суть: Заставьте нейросеть написать скрипт для очистки, а не делайте это вручную.
Промт:
У меня есть DataFrame с пропусками, дубликатами и выбросами. Напиши код на Python с pandas для:
- удаления дубликатов по колонке 'id'
- заполнения пропусков в 'age' медианой, в 'income' — средним
- обработки выбросов методом IQR (межквартильный размах)
- приведения типов данных
Добавь комментарии и выведи статистику до/после.
Пример:
import pandas as pd
import numpy as np
df = pd.read_csv('data.csv')
print('До:', df.shape)
df = df.drop_duplicates(subset='id')
df['age'] = df['age'].fillna(df['age'].median())
df['income'] = df['income'].fillna(df['income'].mean())
Q1 = df['income'].quantile(0.25)
Q3 = df['income'].quantile(0.75)
IQR = Q3 - Q1
df = df[(df['income'] >= Q1 - 1.5*IQR) & (df['income'] <= Q3 + 1.5*IQR)]
df['age'] = df['age'].astype(int)
print('После:', df.shape)
2. EDA за минуту: автогенерация отчёта
Суть: Получить полный разведочный анализ без написания десятков строк кода.
Промт:
Сгенерируй Python-код для EDA датасета 'titanic.csv':
- распределение признаков (гистограммы, boxplot)
- матрица корреляций (heatmap)
- анализ пропусков
- cross-tabulation между 'Pclass' и 'Survived'
Используй seaborn и matplotlib. Выведи выводы по каждому графику.
3. Фичи, которые повысят точность модели
Суть: Нейросеть подскажет, какие признаки создать, чтобы улучшить метрики.
Промт:
Для датасета о клиентах банка (колонки: age, income, debt, default) предложи 5 новых признаков, которые могут повысить точность модели классификации дефолта. Объясни, почему каждый признак полезен, и напиши код на pandas для их создания.
Пример ответа:
df['debt_to_income'] = df['debt'] / df['income']
df['age_bucket'] = pd.cut(df['age'], bins=[18,30,40,50,100], labels=['young','mid','senior','retired'])
# и т.д.
4. Подбор модели: пусть ИИ сравнивает
Суть: Сравнить несколько алгоритмов на ваших данных и выбрать лучший.
Промт:
У меня есть датасет для бинарной классификации (целевая колонка 'churn'). Напиши код на Python с использованием scikit-learn, который:
- разделит данные на train/test
- обучит LogisticRegression, RandomForest, XGBoost
- выведет accuracy, precision, recall, F1-score для каждой модели
- построит ROC-кривые для сравнения
Добавь интерпретацию результатов.
5. Интерпретация модели: SHAP и LIME
Суть: Объяснить, почему модель приняла решение — критично для бизнеса.
Промт:
Обучи модель RandomForest на датасете 'credit_risk.csv'. Используй библиотеку SHAP (shap.TreeExplainer) для объяснения предсказаний. Выведи summary plot и объясни, какие признаки влияют на риск дефолта.
6. Визуализация, которая говорит сама за себя
Суть: Создать дашборд на Plotly для интерактивного анализа.
Промт:
Сгенерируй код на Python с Plotly для дашборда по продажам (файл sales.csv: date, region, product, revenue). Включи:
- line chart динамики выручки по месяцам
- bar chart по регионам
- pie chart по продуктам
- фильтры по дате и региону
Сделай дашборд в одном HTML-файле.
7. SQL-запросы без ошибок
Суть: Написать сложный SQL-запрос на естественном языке.
Промт:
Напиши SQL-запрос для PostgreSQL: вывести топ-10 клиентов по сумме заказов за последний год, с их средним чеком и количеством заказов. Таблицы: customers(id, name), orders(id, customer_id, amount, created_at).
8. Автоматизация отчётов: email-рассылка
Суть: Скрипт, который собирает данные, строит график и отправляет по почте.
Промт:
Напиши Python-скрипт, который:
- читает данные из CSV
- строит график продаж за неделю (matplotlib)
- отправляет письмо с графиком на указанный email через SMTP
Добавь обработку ошибок и логирование.
9. Генерация синтетических данных
Суть: Когда реальных данных мало, а модель обучать надо.
Промт:
Сгенерируй 1000 строк синтетических данных о сотрудниках (возраст, зарплата, отдел, стаж) с помощью Python (numpy/pandas). Используй реалистичные распределения: возраст от 20 до 60, зарплата коррелирует со стажем. Выведи первые 5 строк.
10. Проверка гипотез: статистика для новичков
Суть: Помощь в выборе статистического теста и его реализации.
Промт:
У меня две группы пользователей (A/B тест). Данные в 'ab_test.csv' (group, conversion). Какой статистический тест применить? Напиши код на Python (scipy.stats) для проверки значимости различий, выведи p-value и сделай вывод.
11. Оптимизация гиперпараметров
Суть: Подобрать лучшие параметры модели с помощью Optuna.
Промт:
Напиши код на Python с библиотекой Optuna для оптимизации гиперпараметров RandomForest на датасете 'churn.csv'. Целевая метрика — ROC-AUC. Выведи лучшие параметры и значение метрики.
12. Объяснение кода: ревью без эксперта
Суть: Нейросеть выступит в роли ревьюера.
Промт:
Вот код на Python для обработки данных. Найди ошибки, предложи улучшения по стилю, производительности и читаемости. Объясни каждое замечание.
Итог
Эти промты — мой ежедневный инструментарий. Они экономят часы, которые раньше уходили на рутину. Попробуйте адаптировать их под свои задачи — и вы почувствуете разницу. А если хотите ещё больше автоматизации, загляните в наш блог — там много материалов про AI-агентов для аналитики.
Пишите в комментариях, какие промты используете вы!
Комментарии