Свежая заметка из репозитория Nothing Threw, обсуждавшаяся на Hacker News, хороша тем, что не продаёт очередную магию агентов. Там описан маленький реальный бизнес, где ИИ-агенты писали код, запускали анализ, публиковали контент и меняли рекламные бюджеты, а затем авторы разобрали шесть сбоев из сорока восьми наблюдавшихся запусков.

Главная польза текста — в масштабе ошибки. Это не катастрофа уровня «модель взломала интернет», а обычная рабочая зона, где агент уже касается денег, клиентов и публичных каналов. В таком месте даже небольшой промах перестаёт быть смешной демонстрацией: неправильно выставленный бюджет, неудачная публикация или уверенно написанный плохой код быстро превращаются в операционный долг.

Авторский урок звучит приземлённо, но именно поэтому важен: агентам в живых процессах нужны скучные журналы действий, точки ручного подтверждения и понятный откат. Без этого процент успешных прогонов может выглядеть прилично, пока один неудачный прогон не попадёт в Stripe, рекламу или клиентскую коммуникацию.

Для команд, которые уже пускают агентов дальше песочницы, это хороший антипример против фразы «оно в основном работает». В бизнесе важны не только средняя успешность и красивая запись экрана, а то, как система ведёт себя в редких, дорогих и плохо обратимых случаях.

Урок: измеряйте и проверяйте поведение агентов в процессах, похожих на продакшен, а не доверяйте общей доле выполненных задач.