9 промтов для Data Science и Pandas: анализ данных и визуализация
В эпоху data-соревнований скорость анализа данных решает всё. Промты для ИИ-ассистентов позволяют получать рабочий код на Python за секунды, экономя время на поиске синтаксиса. В этой подборке — проверенные промты для Pandas, Matplotlib и Seaborn, основанные на официальной документации: Pandas, Matplotlib, Seaborn. Используйте их как шаблоны, подставляя свои данные.
Промт — это инструкция для нейросети, которая превращает вашу задачу в готовый код. Чтобы промт работал, укажите библиотеку, действия и ожидаемый формат. Все приведённые ниже примеры уже готовы к копированию.
Промт 1. Первичный осмотр данных
Когда: получили новый датасет.
Промт: «Загрузи CSV, выведи первые 5 строк, типы данных, статистику по числовым колонкам и количество дубликатов.»
import pandas as pd
df = pd.read_csv('data.csv')
print(df.head())
print(df.info())
print(df.describe())
print('Дубликатов:', df.duplicated().sum())
Этот код показывает структуру данных, пропуски и основные статистики.
Промт 2. Очистка данных
Когда: нужно избавиться от пропусков и повторов.
Промт: «Заполни пропуски в числовых колонках медианой, в категориальных — модой. Удали дубликаты. Покажи число строк до/после.»
before = len(df)
df.fillna(df.median(numeric_only=True), inplace=True)
for col in df.select_dtypes(include=['object']).columns:
df[col].fillna(df[col].mode()[0], inplace=True)
df.drop_duplicates(inplace=True)
print(f'Было {before}, стало {len(df)}')
Выбирайте медиану и моду для устойчивости к выбросам.
Промт 3. Фильтрация данных
Когда: выделить подмножество строк по условию.
Промт: «Отфильтруй записи, где 'age' > 30 и 'salary' < 50000. Выведи среднюю зарплату в группе.»
filtered = df[(df['age'] > 30) & (df['salary'] < 50000)]
print('Записей:', len(filtered))
print('Средняя зарплата:', filtered['salary'].mean())
Промт 4. Группировка и агрегация
Когда: нужна статистика по категориям.
Промт: «Сгруппируй по 'department' и посчитай среднюю зарплату, медиану и количество записей.»
result = df.groupby('department')['salary'].agg(['mean', 'median', 'count'])
print(result)
Промт 5. Сводная таблица
Когда: анализ пересечения двух признаков.
Промт: «Создай pivot_table со средними 'sales' по 'product' и 'region'. Добавь итоги.»
pivot = df.pivot_table(values='sales', index='product',
columns='region', aggfunc='mean', margins=True)
print(pivot)
Промт 6. Визуализация распределения
Когда: проверить форму распределения и выбросы.
Промт: «Построй гистограмму и boxplot для 'age' через seaborn.»
import seaborn as sns
import matplotlib.pyplot as plt
fig, axes = plt.subplots(1, 2, figsize=(12,4))
sns.histplot(df['age'], kde=True, ax=axes[0])
sns.boxplot(y='age', data=df, ax=axes[1])
plt.show()
Промт 7. Визуализация зависимостей
Когда: выявить связь между признаками.
Промт: «Создай scatterplot 'height' vs 'weight' с цветом по 'gender' и pairplot для числовых колонок.»
sns.scatterplot(data=df, x='height', y='weight', hue='gender')
sns.pairplot(df[['height','weight','age','salary']])
Промт 8. Корреляционная матрица
Когда: нужна количественная мера связи.
Промт: «Построй тепловую карту корреляций числовых признаков.»
corr = df.corr()
sns.heatmap(corr, annot=True, cmap='coolwarm')
Промт 9. Автогенерация отчёта
Когда: подготовить выводы для руководства.
Промт: «Напиши маркированный список инсайтов по данным: статистики, пропуски, корреляции, выбросы.»
AI сгенерирует текстовый отчёт. Пример: «Средний возраст — 37 лет, медианная зарплата — $42 000, пропусков — 12, выбросов — 3.»
Советы по использованию
- Всегда указывайте конкретные названия колонок в промте.
- Для больших датасетов добавляйте
.sample(1000)в код, чтобы визуализация не тормозила. - Проверяйте версии библиотек: Pandas 2.x, Matplotlib 3.7+, Seaborn 0.13+.
- Если AI выдаёт ошибку, уточните промт, добавив пример входных данных.
Заключение
Эти 9 промтов покрывают 90% рутины аналитика. Адаптируйте под свои данные и получайте результат за минуту. Комбинируйте промты для сложных задач. Не забывайте проверять сгенерированный код, адаптируя названия колонок. Подборка основана на официальной документации библиотек — это гарантия корректности. Сохраните статью в закладки, чтобы шпаргалка была под рукой.
Комментарии