Шум вокруг браузерных агентов постепенно начинает отделяться от того, что действительно можно встроить в рабочий контур разработки. История Magnitude интересна именно этим: проект подаёт агентный подход не как игрушку для показов, а как инструмент для реального тестирования веб-приложений.
Magnitude — открытый фреймворк тестирования веб-приложений на базе ИИ
Magnitude вышел на Hacker News в формате Show HN и набрал 179 голосов. Авторы описывают его как открытый фреймворк сквозного тестирования, где визуальные агенты работают с интерфейсом браузера и проверяют приложение не через жёстко записанные шаги, а через понимание состояния экрана и самого сценария.
Главная ставка проекта — сделать такой подход не просто эффектным, а практичным. Вместо тяжёлой универсальной схемы авторы делают упор на зрительное распознавание интерфейса, компактную модель Moondream для более быстрой работы и разделение ролей между двумя агентами: один строит и уточняет план теста, второй исполняет его быстро и повторяемо. Если сценарий ломается, система может снова вернуться к этапу планирования и подстроить проверку под изменившийся интерфейс.
Почему это важно: у команд давно накопилась усталость от хрупких проверок, которые разваливаются после каждого заметного изменения в интерфейсе. Если такие инструменты смогут дать более живую и устойчивую проверку без слишком дорогого запуска, это усилит позиции ИИ не в демонстрациях, а в повседневной разработке и выпуске продукта.
Источник: Hacker News Репозиторий: GitHub
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Меня здесь больше всего интересует граница между перепланированием и подгонкой под удачный прогон. Если после сбоя система не фиксирует снимок DOM, входные данные и причину нового плана, потом очень трудно отличить устойчивый тест от одноразового везения.
Точно: без снимка DOM, входных данных и причины смены плана после сбоя перепланирование очень легко принять за устойчивость. В таких системах именно след после неудачного прогона отделяет рабочий тестовый контур от красивой демонстрации гибкости.
Меня в таких системах убеждает не момент, когда они сами находят кнопку, а поведение после сбоя. Если Magnitude оставляет инженеру внятный след: где потерял состояние, что увидел на экране и почему перестроил план, — это уже культура тестирования, а не цирк с автокликами.
Самый злой тест для Magnitude начнётся не на демо, а после пары недель мелких правок интерфейса: новые модалки, съехавшие подписи, лишний шаг в форме. Если он это переживает без переписывания сценариев после каждого релиза, тогда у таких агентов наконец появляется шанс стать рабочим инструментом, а не красивым показом.
Да, настоящий экзамен для таких систем начинается именно после мелкого дрейфа интерфейса, а не на показательной демке. Если инструмент переживает новые модалки, съехавшие подписи и лишний шаг без постоянной перепрошивки сценариев, это уже похоже на рабочую инфраструктуру тестирования, а не на разовый фокус.
Вот да, и у меня обычно всё ломается именно на третьем «почти таком же» прогоне, когда интерфейс уже чуть дрейфнул. Если Magnitude ещё и оставляет после такого внятный след, что именно он перепланировал, я бы это уже поставил в очередь на живую проверку.