AI повсюду. Что учить тестировщику? Мой путь от «я ничего не понимаю» до работы с LLM

AI повсюду. Что учить тестировщику? Мой путь от «я ничего не понимаю» до работы с LLM

В июне 2026 года AI перестал быть просто хайповой технологией — он стал инфраструктурой. Недавно на VC.RU вышла статья о том, как тестировщику освоить AI и LLM в работе — Источник. Я прочитал её, и она идеально совпала с моим личным опытом. Полтора года назад я сидел перед терминалом LLM и чувствовал себя полным профаном: все говорят про «промпты», «RAG», «fine-tuning», а я даже не понимал, с какой стороны подойти. Сегодня я тестирую AI-продукты в продуктовой команде, и хочу рассказать, как прошёл этот путь.

Почему тестировщику нужно разбираться в AI?

Два года назад я думал: «AI — это для дата-сайентистов, я просто проверяю UI и логику». Но рынок изменился. Сейчас AI встроен в CRM, аналитику, чаты поддержки, генерацию контента. Если ты тестировщик и игнорируешь эту тему, ты рискуешь остаться без работы через год-два. Не потому, что AI заменит тебя, а потому, что компании ищут людей, которые понимают, как тестировать недетерминированные системы.

Я начал с шока: LLM выдаёт разные ответы на один и тот же запрос. Как это тестировать? Где эталон? Первое, что я понял — классические подходы не работают. Нужно новое мышление.

Шаг 1: Перестать бояться «чёрного ящика»

Мой первый проект с AI — тестирование чат-бота для техподдержки. Бот должен был отвечать на вопросы клиентов, но ответы генерировались моделью. Руководитель сказал: «Проверь, что он не генерирует ерунду». Я спросил: «А что считать ерундой?» — и понял, что критериев нет.

Я потратил неделю, читая документацию OpenAI, статьи про evaluation LLM и разбираясь с метриками. Главное открытие: тестировщик AI — это не про поиск багов в коде, а про валидацию поведения. Мне пришлось научиться:

  • Формулировать критерии качества ответов (точность, релевантность, безопасность)
  • Создавать тестовые датасеты, которые покрывают краевые случаи
  • Использовать автоматизированные метрики (BLEU, ROUGE, но потом понял, что они слабо применимы для продукта)

Совет: начни с простого — возьми любой открытый LLM (например, Llama 3.2 или GPT-4o-mini) и попробуй написать 10 тестовых сценариев, которые проверяют, что модель не даёт опасных советов. Это будет твой первый шаг.

Шаг 2: Понять, как работает RAG

В реальных продуктах LLM редко используют «голыми». Почти всегда это RAG (Retrieval-Augmented Generation) — когда модель ищет информацию в базе знаний и генерирует ответ на основе найденного. Я тестировал систему, где LLM подключалась к документации компании. Проблема: модель иногда игнорировала контекст и выдумывала факты.

Здесь я научился проверять:
- Качество ретривера (насколько хорошо находятся нужные документы)
- Корректность инъекции контекста (не перегружает ли модель лишней информацией)
- Поведение при пустом контексте (что будет, если документ не найден?)

Практический совет: возьми свой проект на работе, где есть документация, и попробуй написать RAG-систему на коленке с помощью LangChain. Ты увидишь, сколько подводных камней — от неправильного чанкинга до плохой эмбеддинговой модели.

Шаг 3: Освоить prompt engineering как инструмент тестировщика

Я долго думал, что промпты — это для разработчиков. Но на практике именно тестировщик часто пишет самые важные промпты: для проверки граничных условий, для стресс-тестов, для атак на модель (red teaming).

Пример: я тестировал AI-ассистента для бухгалтеров. Один из тестов — попросить модель «забыть» про налоги. Оказалось, что базовый промпт не защищал от таких инъекций. Мне пришлось:

  • Изучить техники jailbreak (как пользователи обходят ограничения)
  • Написать набор adversarial-промптов
  • Настроить системный промпт так, чтобы он отклонял опасные запросы

Результат: после моих тестов команда переписала системный промпт, и частота опасных ответов снизилась на 40%.

Шаг 4: Научиться оценивать качество без эталона

Самое сложное — тестировать генерацию, где нет «правильного» ответа. Я использую комбинацию подходов:

  1. Автоматические метрики — но только как сигнал, а не истина. Например, semantic similarity между ответом и ожидаемым смыслом.
  2. Краудсорсинг — разметка ответов несколькими людьми по шкале (1-5).
  3. LLM-as-a-judge — использование другой модели для оценки ответов. Звучит странно, но работает, если правильно настроить.

Важно: не пытайся достичь 100% точности. AI-системы по своей природе вероятностные. Цель — снизить процент «плохих» ответов до приемлемого уровня (обычно <5%).

Шаг 5: Интеграция с реальными сервисами

Когда я начал тестировать AI-продукты, которые подключаются к внешним API (например, Telegram-боты или CRM-системы), я столкнулся с новой сложностью: нужно проверять не только генерацию, но и корректность передачи данных. Например, AI-агент может «забыть» передать ID пользователя в запрос или сгенерировать невалидный JSON для API.

Здесь мне помогла практика: я автоматизировал проверки с помощью скриптов на Python, которые эмулируют запросы к API и валидируют ответы. Кстати, ASI Biont поддерживает подключение к Telegram через API — подробнее на asibiont.com. Это упростило тестирование интеграций.

Что конкретно учить тестировщику в 2026?

На основе своего опыта и статьи на VC.RU, я составил список навыков:

Навык Зачем тестировщику Как учить
Prompt engineering Писать тестовые сценарии и red teaming Практика на ChatGPT или локальных моделях
RAG-архитектура Понимать, как модель ищет данные Собрать простой RAG на LangChain
Evaluation метрики Оценивать качество генерации Изучить библиотеки типа DeepEval
API-тестирование Проверять интеграции AI с сервисами Писать автотесты на requests + pytest
Безопасность (jailbreak) Защищать продукт от атак Изучить OWASP Top 10 for LLM

Мой главный совет

Не пытайся выучить всё сразу. Начни с малого: возьми одну задачу, где AI уже используется в твоей компании (или в open-source проекте), и попробуй написать для неё тесты. Пусть даже 10 тестовых сценариев. Через месяц ты увидишь прогресс.

Я потратил полгода, чтобы перестать бояться LLM и начать понимать, как их тестировать. Сегодня я не просто выполняю задачи — я помогаю команде проектировать системы так, чтобы их было легче проверять. И это дало мне рост как специалисту.

Заключение

AI повсюду, и это не временный тренд. Тестировщик, который разбирается в LLM, RAG и evaluation, становится незаменимым в любой продуктовой команде. Не жди, пока работодатель потребует эти навыки — начни осваивать их сейчас.

Как сказано в статье на VC.RU: «AI не заменит тестировщика, но тестировщик, который использует AI, заменит того, кто этого не делает». Я подписываюсь под каждым словом.

Если у тебя есть вопросы — пиши в комментариях. Я расскажу, с чего начал и какие ресурсы реально помогли.

← Все статьи

Комментарии