От CSV до дашборда: 12 промтов, которые заменят мне джуна по данным

От CSV до дашборда: 12 промтов, которые заменят мне джуна по данным

Каждый день я работаю с данными: то pandas, то SQL, то визуализация. И знаете, что? 80% рутины можно отдать нейросети, если правильно составить промт. Я собрал 12 проверенных промтов, которые реально ускоряют мою работу — от очистки данных до интерпретации моделей. Никакой воды, только код и примеры.

1. Чистка данных без боли: промт для pandas

Суть: Заставьте нейросеть написать скрипт для очистки, а не делайте это вручную.

Промт:

У меня есть DataFrame с пропусками, дубликатами и выбросами. Напиши код на Python с pandas для:
- удаления дубликатов по колонке 'id'
- заполнения пропусков в 'age' медианой, в 'income' — средним
- обработки выбросов методом IQR (межквартильный размах)
- приведения типов данных
Добавь комментарии и выведи статистику до/после.

Пример:

import pandas as pd
import numpy as np

df = pd.read_csv('data.csv')
print('До:', df.shape)
df = df.drop_duplicates(subset='id')
df['age'] = df['age'].fillna(df['age'].median())
df['income'] = df['income'].fillna(df['income'].mean())
Q1 = df['income'].quantile(0.25)
Q3 = df['income'].quantile(0.75)
IQR = Q3 - Q1
df = df[(df['income'] >= Q1 - 1.5*IQR) & (df['income'] <= Q3 + 1.5*IQR)]
df['age'] = df['age'].astype(int)
print('После:', df.shape)

2. EDA за минуту: автогенерация отчёта

Суть: Получить полный разведочный анализ без написания десятков строк кода.

Промт:

Сгенерируй Python-код для EDA датасета 'titanic.csv':
- распределение признаков (гистограммы, boxplot)
- матрица корреляций (heatmap)
- анализ пропусков
- cross-tabulation между 'Pclass' и 'Survived'
Используй seaborn и matplotlib. Выведи выводы по каждому графику.

3. Фичи, которые повысят точность модели

Суть: Нейросеть подскажет, какие признаки создать, чтобы улучшить метрики.

Промт:

Для датасета о клиентах банка (колонки: age, income, debt, default) предложи 5 новых признаков, которые могут повысить точность модели классификации дефолта. Объясни, почему каждый признак полезен, и напиши код на pandas для их создания.

Пример ответа:

df['debt_to_income'] = df['debt'] / df['income']
df['age_bucket'] = pd.cut(df['age'], bins=[18,30,40,50,100], labels=['young','mid','senior','retired'])
# и т.д.

4. Подбор модели: пусть ИИ сравнивает

Суть: Сравнить несколько алгоритмов на ваших данных и выбрать лучший.

Промт:

У меня есть датасет для бинарной классификации (целевая колонка 'churn'). Напиши код на Python с использованием scikit-learn, который:
- разделит данные на train/test
- обучит LogisticRegression, RandomForest, XGBoost
- выведет accuracy, precision, recall, F1-score для каждой модели
- построит ROC-кривые для сравнения
Добавь интерпретацию результатов.

5. Интерпретация модели: SHAP и LIME

Суть: Объяснить, почему модель приняла решение — критично для бизнеса.

Промт:

Обучи модель RandomForest на датасете 'credit_risk.csv'. Используй библиотеку SHAP (shap.TreeExplainer) для объяснения предсказаний. Выведи summary plot и объясни, какие признаки влияют на риск дефолта.

6. Визуализация, которая говорит сама за себя

Суть: Создать дашборд на Plotly для интерактивного анализа.

Промт:

Сгенерируй код на Python с Plotly для дашборда по продажам (файл sales.csv: date, region, product, revenue). Включи:
- line chart динамики выручки по месяцам
- bar chart по регионам
- pie chart по продуктам
- фильтры по дате и региону
Сделай дашборд в одном HTML-файле.

7. SQL-запросы без ошибок

Суть: Написать сложный SQL-запрос на естественном языке.

Промт:

Напиши SQL-запрос для PostgreSQL: вывести топ-10 клиентов по сумме заказов за последний год, с их средним чеком и количеством заказов. Таблицы: customers(id, name), orders(id, customer_id, amount, created_at).

8. Автоматизация отчётов: email-рассылка

Суть: Скрипт, который собирает данные, строит график и отправляет по почте.

Промт:

Напиши Python-скрипт, который:
- читает данные из CSV
- строит график продаж за неделю (matplotlib)
- отправляет письмо с графиком на указанный email через SMTP
Добавь обработку ошибок и логирование.

9. Генерация синтетических данных

Суть: Когда реальных данных мало, а модель обучать надо.

Промт:

Сгенерируй 1000 строк синтетических данных о сотрудниках (возраст, зарплата, отдел, стаж) с помощью Python (numpy/pandas). Используй реалистичные распределения: возраст от 20 до 60, зарплата коррелирует со стажем. Выведи первые 5 строк.

10. Проверка гипотез: статистика для новичков

Суть: Помощь в выборе статистического теста и его реализации.

Промт:

У меня две группы пользователей (A/B тест). Данные в 'ab_test.csv' (group, conversion). Какой статистический тест применить? Напиши код на Python (scipy.stats) для проверки значимости различий, выведи p-value и сделай вывод.

11. Оптимизация гиперпараметров

Суть: Подобрать лучшие параметры модели с помощью Optuna.

Промт:

Напиши код на Python с библиотекой Optuna для оптимизации гиперпараметров RandomForest на датасете 'churn.csv'. Целевая метрика — ROC-AUC. Выведи лучшие параметры и значение метрики.

12. Объяснение кода: ревью без эксперта

Суть: Нейросеть выступит в роли ревьюера.

Промт:

Вот код на Python для обработки данных. Найди ошибки, предложи улучшения по стилю, производительности и читаемости. Объясни каждое замечание.

Итог

Эти промты — мой ежедневный инструментарий. Они экономят часы, которые раньше уходили на рутину. Попробуйте адаптировать их под свои задачи — и вы почувствуете разницу. А если хотите ещё больше автоматизации, загляните в наш блог — там много материалов про AI-агентов для аналитики.

Пишите в комментариях, какие промты используете вы!

← Все статьи

Комментарии