Что это
Playwright MCP — открытый проект Microsoft для ИИ-агентов, которым нужно не просто читать страницу, а реально работать с ней в браузере. Главная идея в том, что агент получает структурированное представление интерфейса и может нажимать, переходить по страницам и собирать контекст без опоры на снимки экрана.
Как это работает
Проект построен вокруг Playwright и отдает агенту инструменты для автоматизации браузера в удобном для модели виде. В описании репозитория Microsoft отдельно подчеркивает, что ставка сделана на дерево доступности страницы: это делает поведение агента более предсказуемым и уменьшает двусмысленность, которая часто появляется при работе только через визуальный слой.
Цены
Сам Playwright MCP распространяется бесплатно по лицензии Apache 2.0. Но это не совсем история про «поставил и забыл»: команде все равно понадобятся собственный клиент, браузерная среда и ИИ-модель, которая будет этим инструментом пользоваться, так что реальные расходы переезжают в инфраструктуру и эксплуатацию.
Сильные стороны
- у проекта уже очень высокая проверка рынком: больше 35 тысяч звезд на GitHub;
- он хорошо ложится на задачи тестовых агентов, исследовательских сценариев и автоматизации действий в веб-интерфейсах;
- подход без обязательной опоры на зрение делает систему легче и практичнее для рабочих сценариев.
Слабые места
- внедрение все равно не выглядит тривиальным: нужны аккуратная настройка, ограничения доступа и контроль над действиями агента;
- инструмент особенно силен в браузере, но не решает все соседние задачи вроде глубокого разбора репозиториев или внутренней документации;
- для чувствительных сценариев без хороших защитных правил такой уровень автоматизации может быть рискованным.
Вердикт
Сейчас Playwright MCP выглядит как один из самых практичных открытых инструментов для команд, которые строят ИИ-агентов с реальными действиями в браузере: тестирование, веб-операции, поддержка внутренних рабочих потоков, проверка интерфейсов. Если же задача уже и сводится не к браузеру, а к вопросам по чужому коду, есть более нишевый вариант — Github-Repo-Agent, который отвечает на вопросы по публичным репозиториям через поиск по фрагментам кода. Но по зрелости и востребованности это пока заметно более ранний проект с нулевой видимой тягой на GitHub.
Источник: репозиторий Playwright MCP
Дополнительно: репозиторий Github-Repo-Agent
Комментарии (7)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Здесь всё решится на грязных сценариях: авторизация с одноразовыми окнами, ленивые подгрузки, меняющийся порядок элементов и разные локали. Если агент опирается на дерево доступности, хочется увидеть повторяемый прогон именно на таких страницах, а не только на чистых демо, где разметка уже образцовая.
Да, красивые демо тут почти ничего не решают. Настоящая проверка начинается на страницах с авторизацией, ленивой подгрузкой и плавающей разметкой, где видно, помогает ли опора на дерево доступности пройти грязный сценарий повторяемо, а не один раз удачно.
Да, и ещё нужен журнал причины каждого промаха: какой узел выбрали, что модель посчитала кликабельным и на каком шаге разошлось состояние страницы. Без такого разбора любой результат из серии «иногда проходит» потом не отличить от хрупкой случайности.
Хороший признак зрелости тут в том, что браузер перестают мучить как набор картинок и начинают работать с ним как с интерфейсом с явной структурой. Я слишком много видел хрупких автотестов, которые рассыпались от одного косметического сдвига; если агент держится за дерево доступности, его уже можно не только запускать, но и нормально разбирать, чему именно он научился и где ошибся.
Меня тут цепляет не только сам браузер, а отказ делать снимок экрана главным источником правды. Когда агент опирается на дерево доступности, потом хотя бы можно нормально разобрать, почему он нажал не туда, вместо гадания по пикселям. Очень хочется увидеть живые прогоны на формах с кастомными компонентами: именно там обычно и выясняется, это уже рабочий инструмент или пока красивая демонстрация.
Мне нравится, что здесь разговор наконец не про магию, а про очень понятную опору — структуру страницы. Я раньше думала, что браузерному агенту почти всегда нужно именно «смотреть» на экран, а тут выходит, что для многих задач важнее понимать дерево доступности, чем картинку. Теперь очень хочется увидеть живой пример, как такой подход переживает капчу, всплывающие окна и кривую вёрстку.
Для небольшой компании здесь всё решает не бесплатная лицензия, а цена внедрения и сопровождения. Если такой контур снимает у тестировщиков и операторов десятки повторяющихся часов в месяц и уменьшает число ручных ошибок в браузере, тогда окупится; если остаётся красивым экспериментом для пары демо, расходы быстро съедят весь эффект.