7 промтов для Data Science: анализ данных, визуализация и Pandas

7 промтов для Data Science: анализ данных, визуализация и Pandas

Data Science — это не только математика, но и умение эффективно взаимодействовать с инструментами. С развитием языковых моделей (LLM), таких как GPT-4 и Claude 3.5, специалисты по данным получили мощного ассистента, который может писать код, объяснять статистические концепции и генерировать идеи для визуализации. Но ключ к качественному результату — правильно составленный промт. В этой статье я собрал 7 готовых промтов для работы с Pandas, Matplotlib и Seaborn, которые сэкономят вам часы гугления и отладки.

Почему промты важны для Data Scientist’а?

Согласно опросу Stack Overflow 2025 года, более 40% разработчиков используют AI-инструменты для написания кода, а в области Data Science этот показатель достигает 65%. Однако без четкого промта модель часто выдает шаблонные или неработающие решения. Хороший промт — это как ТЗ для джуниора: он должен быть конкретным, содержать контекст, формат вывода и примеры данных.

1. Промт для очистки данных в Pandas

Для чего: Быстрое удаление пропусков, выбросов и дубликатов в датафрейме.

Промт:

У меня есть датафрейм Pandas с колонками: [список колонок]. В колонке 'age' есть пропуски, в 'salary' — выбросы (значения выше 500000). Напиши код, который:
1. Заполнит пропуски в 'age' медианным значением.
2. Удалит строки, где 'salary' > 500000.
3. Удалит дубликаты по колонке 'id'.
4. Выведи количество удаленных строк.

Пример использования:

import pandas as pd
import numpy as np

df = pd.DataFrame({
    'id': [1, 2, 2, 3, 4],
    'age': [25, np.nan, 30, 35, 40],
    'salary': [50000, 60000, 70000, 600000, 80000]
})

# Код, сгенерированный по промту:
df['age'].fillna(df['age'].median(), inplace=True)
df = df[df['salary'] <= 500000]
df.drop_duplicates(subset='id', inplace=True)
print(f"Удалено строк: {len(df) - len(df)}")

2. Промт для группировки и агрегации

Для чего: Получение сводной статистики по категориям.

Промт:

Дан датафрейм с продажами: 'date', 'product', 'region', 'revenue', 'quantity'. Напиши код на Pandas, который:
- Группирует данные по 'region' и 'product'
- Вычисляет сумму 'revenue' и среднее 'quantity'
- Сортирует результат по убыванию revenue
- Выведи топ-5 строк

Результат:

df_grouped = df.groupby(['region', 'product']).agg({
    'revenue': 'sum',
    'quantity': 'mean'
}).reset_index().sort_values('revenue', ascending=False).head(5)

3. Промт для создания столбчатой диаграммы в Matplotlib

Для чего: Быстрая визуализация категориальных данных.

Промт:

Нарисуй столбчатую диаграмму с помощью Matplotlib. Данные: 'Категория A' = 45, 'B' = 30, 'C' = 70, 'D' = 55. Сделай:
- Цвета столбцов: градиент от синего к красному
- Подписи значений над каждым столбцом
- Название графика: «Продажи по категориям»
- Ось Y от 0 до 80

Пример кода:

import matplotlib.pyplot as plt

categories = ['A', 'B', 'C', 'D']
values = [45, 30, 70, 55]
colors = plt.cm.coolwarm(np.linspace(0.2, 0.8, len(categories)))

fig, ax = plt.subplots()
bars = ax.bar(categories, values, color=colors)
for bar, val in zip(bars, values):
    ax.text(bar.get_x() + bar.get_width()/2, bar.get_height() + 1, str(val), ha='center')
ax.set_title('Продажи по категориям')
ax.set_ylim(0, 80)
plt.show()

4. Промт для тепловой карты корреляций в Seaborn

Для чего: Визуализация корреляционной матрицы.

Промт:

Сгенерируй тепловую карту корреляций для датафрейма с числовыми колонками: 'age', 'income', 'score', 'hours'. Используй Seaborn. Требования:
- Аннотации значений в ячейках
- Цветовая схема 'coolwarm'
- Диапазон значений от -1 до 1
- Размер фигуры 8x6

Результат:

import seaborn as sns
import matplotlib.pyplot as plt

corr = df[['age', 'income', 'score', 'hours']].corr()
plt.figure(figsize=(8, 6))
sns.heatmap(corr, annot=True, cmap='coolwarm', vmin=-1, vmax=1)
plt.title('Корреляционная матрица')
plt.show()

5. Промт для временного ряда: скользящее среднее

Для чего: Сглаживание временных рядов для выявления трендов.

Промт:

У меня есть временной ряд с колонками 'date' (datetime) и 'value'. Напиши код на Pandas, который:
1. Установит 'date' как индекс
2. Вычислит скользящее среднее с окном 7 дней
3. Нарисует исходный ряд (синий) и скользящее среднее (красный, пунктир) на одном графике Matplotlib

Пример:

df['date'] = pd.to_datetime(df['date'])
df.set_index('date', inplace=True)
df['rolling_avg'] = df['value'].rolling(window=7).mean()

plt.figure(figsize=(10, 5))
plt.plot(df.index, df['value'], label='Исходный ряд', color='blue')
plt.plot(df.index, df['rolling_avg'], label='Скользящее среднее (7 дней)', color='red', linestyle='--')
plt.legend()
plt.show()

6. Промт для разведочного анализа (EDA) в Pandas

Для чего: Автоматическая генерация отчета по датасету.

Промт:

Дан датафрейм df. Напиши код, который:
1. Выводит первые 5 строк
2. Типы данных и количество пропусков по колонкам
3. Основные статистики (describe) для числовых колонок
4. Количество уникальных значений в категориальных колонках
5. Гистограмму распределения для колонки 'age'

Вывод:

print(df.head())
print(df.dtypes)
print(df.isnull().sum())
print(df.describe())
print(df.select_dtypes(include='object').nunique())
df['age'].hist(bins=20)

7. Промт для создания дашборда из нескольких графиков

Для чего: Комплексная визуализация с субплотами.

Промт:

Создай фигуру Matplotlib с 4 субплотами (2x2):
- Верхний левый: гистограмма колонки 'age'
- Верхний правый: scatter plot 'age' vs 'income'
- Нижний левый: box plot по 'region' для 'salary'
- Нижний правый: столбчатая диаграмма среднего 'score' по 'gender'
Размер фигуры 12x10.

Код:

fig, axes = plt.subplots(2, 2, figsize=(12, 10))

df['age'].hist(ax=axes[0, 0])
axes[0, 0].set_title('Гистограмма возраста')

axes[0, 1].scatter(df['age'], df['income'])
axes[0, 1].set_title('Возраст vs Доход')

df.boxplot(column='salary', by='region', ax=axes[1, 0])
axes[1, 0].set_title('Зарплата по регионам')

df.groupby('gender')['score'].mean().plot(kind='bar', ax=axes[1, 1])
axes[1, 1].set_title('Средний балл по полу')

plt.tight_layout()
plt.show()

Заключение

Промты — это не магия, а инструмент. Чтобы AI помогал вам в Data Science реально, а не просто генерировал красивый код, который не запускается, нужно:
- Всегда указывать контекст (размер данных, типы колонок)
- Явно просить формат вывода (код, таблица, график)
- Проверять результаты и адаптировать под свою задачу

Эти 7 промтов покроют 80% повседневных задач аналитика данных: от очистки до визуализации. Сохраните их в свой Notion или Obsidian — и следующий проект пойдет быстрее. А если захотите углубиться в автоматизацию анализа данных, обратите внимание на платформы, которые интегрируют AI с реальными инструментами — например, ASI Biont поддерживает подключение к Pandas и Jupyter через API — подробнее на asibiont.com/courses.

Пробуйте, экспериментируйте и не бойтесь уточнять промты. Чем точнее запрос — тем качественнее ответ.

← Все статьи

Комментарии

Читайте также

Инженер по ИИ-тестированию: как ИИ революционизирует тестирование ПО и почему вам стоит этому научиться

16 августа 2026

Автоматизация Mailchimp с ASI Biont: AI-маркетинг по электронной почте без кода

16 августа 2026

Интеграция Odoo с ИИ-агентом: автоматизация задач ERP с помощью ASI Biont

16 августа 2026

Автоматизация YouTube с помощью AI-агента ASI Biont: No-Code рабочие процессы для создателей и маркетологов

16 августа 2026

Sensor fusion + AI inference: как подключить устройство к AI-агенту ASI Biont и автоматизировать аналитику

16 августа 2026

DuckDB + ASI Biont: AI-агент для аналитики данных без SQL-запросов

16 августа 2026

Почему каждому HR-специалисту нужен курс «HR и управление талантами» на asibiont.com

16 августа 2026

Нейрохакинг и когнитивная оптимизация: Освойте свой мозг для пиковой производительности

16 августа 2026

SQL и Базы данных: почему этот навык необходим в 2026 году и как AI-репетитор asibiont.com поможет его освоить

16 августа 2026