Data Science в 2026: почему промты стали новым SQL
Рынок Data Science продолжает расти: по данным Bureau of Labor Statistics, спрос на специалистов по данным и машинному обучению в США с 2024 по 2034 год вырастет на 36% — это гораздо быстрее среднего по всем профессиям. В России, по оценкам Ассоциации больших данных, дефицит аналитиков и ML-инженеров остаётся на уровне десятков тысяч человек. Компании всё чаще требуют не просто знания Python, а умения быстро извлекать инсайты и строить модели. На помощь приходят большие языковые модели (LLM). Но чтобы получить от них пользу, нужны правильные промты — точные, структурированные запросы.
В этой подборке — 12 промтов, которые я ежедневно использую в работе над ML-проектами: от очистки данных до визуализации и интерпретации моделей. Каждый промт проверен на реальных задачах, содержит пример и пояснение. Вы можете адаптировать их под свои данные и инструменты.
1. Автоматическая очистка и профилирование данных
Промт:
Ты — эксперт по очистке данных. У меня есть датафрейм pandas df с {n} строками и {m} столбцами. Вот информация о столбцах: {df.dtypes}. Вот первые 5 строк: {df.head()}. Предложи пошаговый план очистки: обработка пропусков, выбросов, дубликатов, приведение типов. Для каждого шага напиши код на Python с комментариями. Учти, что целевая переменная — {target}.
Пример: Для датасета с ценами на недвижимость (Kaggle House Prices) промт помог выявить, что столбец GarageYrBlt содержит 5% пропусков, а SalePrice имеет выбросы. Модель предложила заменить пропуски медианой по группам и использовать логарифмирование целевой переменной.
Почему работает: LLM анализирует статистику и генерирует код, экономя часы рутинной работы.
2. Генерация новых признаков (Feature Engineering)
Промт:
Ты — feature engineering эксперт. У меня есть датафрейм с признаками: {список признаков}. Целевая переменная — {target}. Предложи 5 новых признаков, которые могут улучшить модель. Для каждого признака: название, формула, код на pandas, обоснование.
Пример: Для задачи предсказания оттока клиентов телеком-компании промт предложил признак «средняя сумма платежа за последние 3 месяца» и «отношение количества обращений в поддержку к сроку обслуживания». Это повысило ROC AUC на 4%.
Совет: Добавьте в промт информацию о бизнес-контексте — это улучшит релевантность признаков.
3. Быстрый EDA с автоматической визуализацией
Промт:
Ты — аналитик данных. Сгенерируй код на Python для EDA датасета: {описание}. Используй matplotlib и seaborn. Нужны: гистограммы распределений, матрица корреляций, boxplot для выбросов, scatter plot для пар признаков. Сохрани графики в папку 'plots'.
Пример: Для датасета Titanic промт создал 10 графиков за 2 минуты, включая выживаемость по полу и классу. Это ускорило первичный анализ в 3 раза.
Почему работает: LLM знает типовые паттерны визуализации и сразу пишет рабочий код.
4. Подбор гиперпараметров с Optuna
Промт:
Напиши код для оптимизации гиперпараметров модели {model} с помощью Optuna. Данные: X_train, y_train. Задай пространство поиска для {список гиперпараметров}. Используй кросс-валидацию на 5 фолдов. Метрика — {metric}. Выведи лучшие параметры и значение метрики.
Пример: Для XGBoost на датасете кредитного скоринга промт сгенерировал исследование 100 комбинаций за 15 минут, улучшив F1 на 7%.
Совет: Укажите n_trials и timeout, чтобы контролировать время.
5. Интерпретация модели с SHAP
Промт:
Ты — эксперт по интерпретации ML. У меня есть обученная модель {model} и данные X_test. Напиши код для расчёта SHAP-значений и визуализации: summary_plot, dependence_plot для топ-3 признаков, force_plot для одного предсказания. Объясни, как читать эти графики.
Пример: Для модели случайного леса в задаче прогнозирования оттока SHAP показал, что ключевой признак — «количество дней с последнего входа». Это помогло бизнесу сфокусироваться на удержании.
Почему работает: SHAP — стандарт интерпретации, а LLM знает синтаксис библиотеки.
6. Генерация синтетических данных
Промт:
Сгенерируй синтетический датасет, похожий на реальный, с помощью Faker и numpy. Параметры: {n} строк, столбцы: {список с типами}. Добавь реалистичные корреляции между признаками. Сохрани в CSV.
Пример: Для тестирования пайплайна в проекте по обнаружению мошенничества промт создал 10 000 транзакций с реалистичным распределением сумм и временных меток.
Совет: Укажите, какие признаки должны быть категориальными, а какие — числовыми.
7. Автоматизация отчётов с pandas-profiling
Промт:
Сгенерируй код для создания HTML-отчёта с помощью pandas-profiling (ydata-profiling) для датасета df. Включи статистику, корреляции, пропуски. Сохрани отчёт как 'report.html'.
Пример: Для датасета с 50 признаками отчёт сгенерировался за 1 минуту и выявил 3 столбца с постоянными значениями, которые были удалены.
Почему работает: ydata-profiling — мощный инструмент, а LLM знает его API.
8. Построение пайплайна в scikit-learn
Промт:
Создай пайплайн scikit-learn для предобработки и обучения модели {model}. Включи: импутацию пропусков, масштабирование числовых признаков, one-hot encoding категориальных, отбор признаков. Напиши код с комментариями.
Пример: Для задачи классификации изображений (tabular) пайплайн включал StandardScaler и PCA, что ускорило обучение на 20%.
Совет: Используйте ColumnTransformer для разных типов столбцов.
9. Визуализация больших данных с Plotly
Промт:
Напиши код для интерактивной визуализации больших данных (10+ млн строк) с Plotly Express. Нужны: scatter plot с кластеризацией, анимация по времени, 3D-график. Используй датасет {название}.
Пример: Для данных о поездках такси в Нью-Йорке промт сгенерировал анимированную карту загрузки улиц по часам.
Почему работает: Plotly поддерживает WebGL для больших данных, LLM знает синтаксис.
10. Работа с SQL для извлечения данных
Промт:
Ты — эксперт по SQL. Напиши запрос для извлечения данных из таблиц {список таблиц} с условиями: {описание}. Нужны агрегации, JOIN, оконные функции. Поясни каждую часть запроса.
Пример: Запрос для вычисления Retention Rate по когортам пользователей занял 10 строк SQL, сгенерированных за секунды.
Совет: Уточните диалект SQL (PostgreSQL, BigQuery и т.д.).
11. Развёртывание модели с FastAPI
Промт:
Создай REST API на FastAPI для модели {model}, сохранённой в joblib. Эндпоинт /predict принимает JSON с признаками, возвращает предсказание. Добавь валидацию через Pydantic. Напиши Dockerfile.
Пример: Для модели предсказания цены квартиры API развернули на сервере за 15 минут.
Почему работает: FastAPI — современный стандарт, LLM генерирует рабочий код.
12. Мониторинг дрейфа данных
Промт:
Напиши код для мониторинга дрейфа данных с помощью библиотеки Evidently. Сравни train и test датасеты по {список признаков}. Выведи отчёт с метриками дрейфа и визуализациями.
Пример: В проекте по прогнозированию спроса Evidently выявил дрейф признака «праздничные дни», что потребовало переобучения модели.
Совет: Настройте пороги оповещений.
Как внедрять промты в рабочий процесс
Начните с малого: выберите один этап (например, очистку данных) и автоматизируйте его с помощью промта. Постепенно расширяйте на другие задачи. Ведите журнал успешных промтов — это ваш личный актив. Помните: LLM не заменяет экспертизу, но усиливает её. Чем точнее промт, тем лучше результат.
Рынок Data Science в 2026 году требует скорости и качества. Промты — это ваш инструмент для достижения обоих. Экспериментируйте, адаптируйте, делитесь находками. И пусть данные работают на вас.
Комментарии