Современные AI-агенты всё чаще берут на себя задачи, которые раньше требовали ручного труда: от поиска конкурентов до мониторинга цен. Но как именно искусственный интеллект «видит» интернет? Ответ кроется в тандеме двух технологий: web search (поисковые запросы) и Playwright (headless-браузер для парсинга динамического контента). В этой статье я, как практикующий разработчик, разберу, как AI обходит ограничения статического HTML и извлекает данные с современных JavaScript-сайтов.
Сегодня, 11 июня 2026 года, когда 90% сайтов используют JS-фреймворки (React, Vue, Angular), старый добрый requests-парсинг практически бесполезен. AI-агент должен не просто найти страницу, но и дождаться загрузки скриптов, кликнуть по кнопкам, прокрутить ленту. Именно здесь на сцену выходит Playwright — инструмент, который эмулирует действия реального пользователя в браузере.
Как AI использует web_search для сбора данных
Первый этап работы AI-агента — это интеллектуальный поиск. В отличие от простого поисковика, AI не просто вбивает запрос и получает ссылки. Он:
- Формулирует гипотезу — на основе задачи (например, «найти цены на iPhone 17 в трёх магазинах») AI генерирует 5-10 вариантов поисковых фраз с LSI-словами (например, «купить iPhone 17 цена», «iPhone 17 стоимость доставка», «смартфоны Apple прайс-лист 2026»).
- Выполняет web_search через API (Google, Bing или внутренние индексы).
- Фильтрует результаты — отсекает рекламные страницы, форумы и зеркала, оставляя только целевые URL.
| Этап | Действие AI | Пример для задачи «мониторинг цен» |
|---|---|---|
| 1 | Генерация запросов | «iPhone 17 Pro цена в Москве», «купить айфон 17 дешево» |
| 2 | Поиск через API | Получение 10-20 URL |
| 3 | Фильтрация по релевантности | Удаление ссылок на Avito и YouTube |
Важный нюанс: AI должен уметь обрабатывать поисковую выдачу как динамический контент. Google, например, подгружает результаты через JavaScript, поэтому для web_search часто требуется headless-браузер уже на этом этапе.
Playwright: головной мозг парсинга JS-сайтов
После получения списка URL начинается самое интересное — парсинг. Playwright позволяет AI-агенту открыть страницу в виртуальном браузере (Chromium, Firefox, WebKit) и выполнять те же действия, что и человек:
- Ожидание загрузки элементов (
.waitForSelector()) - Скроллинг до бесконечности (для лент соцсетей)
- Клики по кнопкам «Показать ещё»
- Заполнение форм и поиск
Почему Playwright, а не Selenium или Puppeteer?
Хотя Puppeteer тоже популярен, Playwright выигрывает за счёт:
- Кросс-браузерности — один код для Chrome, Safari, Edge.
- Автоматического ожидания — не нужно ставить time.sleep().
- Работы с iframe и pop-up окнами — это критично для современных интернет-магазинов.
Вот пример кода на Python, который использует AI-агент для извлечения цены с динамического сайта:
from playwright.sync_api import sync_playwright
import json
with sync_playwright() as p:
browser = p.chromium.launch(headless=True)
page = browser.new_page()
page.goto('https://example-shop.com/product/iphone-17')
# Ожидаем, пока JS загрузит цену
page.wait_for_selector('.price-final', timeout=10000)
price = page.text_content('.price-final')
print(f'Цена: {price}')
browser.close()
Этот код — основа работы AI-агента: он открывает страницу, ждёт динамическую загрузку и парсит элемент, который не появился бы в статическом HTML.
Как AI объединяет web_search и Playwright
Процесс выглядит как конвейер:
- AI получает задание → например, «Собери цены на ноутбуки ASUS в трёх крупных магазинах».
- Выполняет web_search → находит URL товарных страниц.
- Запускает Playwright → для каждого URL парсит цену, название, рейтинг.
- Анализирует и структурирует → сохраняет данные в JSON или CSV.
Практический кейс: В июне 2026 года наш AI-агент (на базе LangChain) использовал эту связку для мониторинга цен на авиабилеты. Мы столкнулись с проблемой: сайты авиакомпаний используют сложную JS-логику (календари цен, загрузка по скроллу). Playwright решил это за счёт эмуляции действий пользователя — агент «кликал» по датам и собирал данные без банов (благодаря рандомизации User-Agent и таймингов).
Лучшие практики для AI-парсинга в 2026
Чтобы ваш AI-агент не был забанен и работал стабильно, соблюдайте правила:
- Используйте ротацию прокси — Playwright легко интегрируется с прокси-пулами.
- Добавляйте задержки —
page.wait_for_timeout(2000)между действиями имитирует человека. - Ограничивайте глубину — не парсите больше 100 страниц с одного IP за минуту.
- Обрабатывайте ошибки — если Playwright не нашёл элемент, AI должен перейти к следующему URL, а не падать.
Заключение: будущее за AI-агентами
Web_search и Playwright — это фундамент, на котором строятся современные AI-решения для сбора данных. Без headless-браузера AI слеп к 70% интернета, а без интеллектуального поиска — просто бессистемно собирает мусор.
Если вы разрабатываете AI-агента для бизнеса (мониторинг цен, анализ конкурентов, сбор новостей), начните с этой связки. Внедрите Playwright как «глаза» вашего AI, и вы увидите, как эффективность парсинга вырастет в 3-5 раз.
Готовы протестировать? Скачайте наш шаблон AI-агента на GitHub (ссылка в описании блога) и попробуйте спарсить данные с любого JS-сайта за 10 минут. Удачи в автоматизации!
Комментарии