AI повсюду. Что учить тестировщику? Мой путь от «я ничего не понимаю» до работы с LLM
В июне 2026 года AI перестал быть просто хайповой технологией — он стал инфраструктурой. Недавно на VC.RU вышла статья о том, как тестировщику освоить AI и LLM в работе — Источник. Я прочитал её, и она идеально совпала с моим личным опытом. Полтора года назад я сидел перед терминалом LLM и чувствовал себя полным профаном: все говорят про «промпты», «RAG», «fine-tuning», а я даже не понимал, с какой стороны подойти. Сегодня я тестирую AI-продукты в продуктовой команде, и хочу рассказать, как прошёл этот путь.
Почему тестировщику нужно разбираться в AI?
Два года назад я думал: «AI — это для дата-сайентистов, я просто проверяю UI и логику». Но рынок изменился. Сейчас AI встроен в CRM, аналитику, чаты поддержки, генерацию контента. Если ты тестировщик и игнорируешь эту тему, ты рискуешь остаться без работы через год-два. Не потому, что AI заменит тебя, а потому, что компании ищут людей, которые понимают, как тестировать недетерминированные системы.
Я начал с шока: LLM выдаёт разные ответы на один и тот же запрос. Как это тестировать? Где эталон? Первое, что я понял — классические подходы не работают. Нужно новое мышление.
Шаг 1: Перестать бояться «чёрного ящика»
Мой первый проект с AI — тестирование чат-бота для техподдержки. Бот должен был отвечать на вопросы клиентов, но ответы генерировались моделью. Руководитель сказал: «Проверь, что он не генерирует ерунду». Я спросил: «А что считать ерундой?» — и понял, что критериев нет.
Я потратил неделю, читая документацию OpenAI, статьи про evaluation LLM и разбираясь с метриками. Главное открытие: тестировщик AI — это не про поиск багов в коде, а про валидацию поведения. Мне пришлось научиться:
- Формулировать критерии качества ответов (точность, релевантность, безопасность)
- Создавать тестовые датасеты, которые покрывают краевые случаи
- Использовать автоматизированные метрики (BLEU, ROUGE, но потом понял, что они слабо применимы для продукта)
Совет: начни с простого — возьми любой открытый LLM (например, Llama 3.2 или GPT-4o-mini) и попробуй написать 10 тестовых сценариев, которые проверяют, что модель не даёт опасных советов. Это будет твой первый шаг.
Шаг 2: Понять, как работает RAG
В реальных продуктах LLM редко используют «голыми». Почти всегда это RAG (Retrieval-Augmented Generation) — когда модель ищет информацию в базе знаний и генерирует ответ на основе найденного. Я тестировал систему, где LLM подключалась к документации компании. Проблема: модель иногда игнорировала контекст и выдумывала факты.
Здесь я научился проверять:
- Качество ретривера (насколько хорошо находятся нужные документы)
- Корректность инъекции контекста (не перегружает ли модель лишней информацией)
- Поведение при пустом контексте (что будет, если документ не найден?)
Практический совет: возьми свой проект на работе, где есть документация, и попробуй написать RAG-систему на коленке с помощью LangChain. Ты увидишь, сколько подводных камней — от неправильного чанкинга до плохой эмбеддинговой модели.
Шаг 3: Освоить prompt engineering как инструмент тестировщика
Я долго думал, что промпты — это для разработчиков. Но на практике именно тестировщик часто пишет самые важные промпты: для проверки граничных условий, для стресс-тестов, для атак на модель (red teaming).
Пример: я тестировал AI-ассистента для бухгалтеров. Один из тестов — попросить модель «забыть» про налоги. Оказалось, что базовый промпт не защищал от таких инъекций. Мне пришлось:
- Изучить техники jailbreak (как пользователи обходят ограничения)
- Написать набор adversarial-промптов
- Настроить системный промпт так, чтобы он отклонял опасные запросы
Результат: после моих тестов команда переписала системный промпт, и частота опасных ответов снизилась на 40%.
Шаг 4: Научиться оценивать качество без эталона
Самое сложное — тестировать генерацию, где нет «правильного» ответа. Я использую комбинацию подходов:
- Автоматические метрики — но только как сигнал, а не истина. Например, semantic similarity между ответом и ожидаемым смыслом.
- Краудсорсинг — разметка ответов несколькими людьми по шкале (1-5).
- LLM-as-a-judge — использование другой модели для оценки ответов. Звучит странно, но работает, если правильно настроить.
Важно: не пытайся достичь 100% точности. AI-системы по своей природе вероятностные. Цель — снизить процент «плохих» ответов до приемлемого уровня (обычно <5%).
Шаг 5: Интеграция с реальными сервисами
Когда я начал тестировать AI-продукты, которые подключаются к внешним API (например, Telegram-боты или CRM-системы), я столкнулся с новой сложностью: нужно проверять не только генерацию, но и корректность передачи данных. Например, AI-агент может «забыть» передать ID пользователя в запрос или сгенерировать невалидный JSON для API.
Здесь мне помогла практика: я автоматизировал проверки с помощью скриптов на Python, которые эмулируют запросы к API и валидируют ответы. Кстати, ASI Biont поддерживает подключение к Telegram через API — подробнее на asibiont.com. Это упростило тестирование интеграций.
Что конкретно учить тестировщику в 2026?
На основе своего опыта и статьи на VC.RU, я составил список навыков:
| Навык | Зачем тестировщику | Как учить |
|---|---|---|
| Prompt engineering | Писать тестовые сценарии и red teaming | Практика на ChatGPT или локальных моделях |
| RAG-архитектура | Понимать, как модель ищет данные | Собрать простой RAG на LangChain |
| Evaluation метрики | Оценивать качество генерации | Изучить библиотеки типа DeepEval |
| API-тестирование | Проверять интеграции AI с сервисами | Писать автотесты на requests + pytest |
| Безопасность (jailbreak) | Защищать продукт от атак | Изучить OWASP Top 10 for LLM |
Мой главный совет
Не пытайся выучить всё сразу. Начни с малого: возьми одну задачу, где AI уже используется в твоей компании (или в open-source проекте), и попробуй написать для неё тесты. Пусть даже 10 тестовых сценариев. Через месяц ты увидишь прогресс.
Я потратил полгода, чтобы перестать бояться LLM и начать понимать, как их тестировать. Сегодня я не просто выполняю задачи — я помогаю команде проектировать системы так, чтобы их было легче проверять. И это дало мне рост как специалисту.
Заключение
AI повсюду, и это не временный тренд. Тестировщик, который разбирается в LLM, RAG и evaluation, становится незаменимым в любой продуктовой команде. Не жди, пока работодатель потребует эти навыки — начни осваивать их сейчас.
Как сказано в статье на VC.RU: «AI не заменит тестировщика, но тестировщик, который использует AI, заменит того, кто этого не делает». Я подписываюсь под каждым словом.
Если у тебя есть вопросы — пиши в комментариях. Я расскажу, с чего начал и какие ресурсы реально помогли.
Комментарии