Разработчик два дня доверял ИИ-агентам реорганизацию ESP-IDF проекта, а потом сделал задачу сам

EffessDev хотел аккуратно разнести проект ESP-IDF по компонентам и по очереди доверял задачу бесплатным моделям через ReptClip. Gemini Flash, Gemini Pro, DeepSeek и другие варианты уверенно вели его к ошибкам сборки, сбросам рабочей директории и новым кругам исправлений. Через два дня автор остановился, спокойно разобрался сам и получил не рекламную историю про магию ИИ, а полезное напоминание: иногда уверенная инструкция модели дороже ручной проверки.

Команда дала парку ИИ-агентов кредитный лимит, и агенты упёрлись в него в тот же день

Ilya Mozerov описывает экспериментальную систему из десяти постоянно работающих агентских сессий: одна пишет код, другая общается в Telegram, третья смотрит сенсоры, четвёртая измеряет саму систему. Обычный журнал событий оказался слабым для вопросов «кто должен?» и «сколько это стоило?», поэтому события начали переводить в журналы hledger с двойной записью для денег, обещаний и труда. Самый честный момент — после появления кредитного лимита агенты выбрали его в тот же день.

Пользователь Claude Code начал логировать подагентов через перехватчик завершения и снизил недельные расходы на 15–20%

Автор думал, что самый медленный помощник — универсальный подагент, но измерения показали другую картину: универсальный сценарий занимал около 18 секунд, исследовательский — 22, а главным тормозом был проверяющий код помощник с 37 секундами. Он стал собирать журналы после сессий Claude Code, разбирать их регулярными рецептами и менять привычки работы. Человеческий сдвиг здесь в переходе от ощущения «агенты дорогие» к настоящей бухгалтерии ИИ-процесса, которая дала экономию примерно 15–20% в неделю.

Автор дал Claude скрейпить Google Maps и посчитал цену вместо спора о хайпе

Orange K ответил на вопрос из сообщества автоматизации не мнением, а экспериментом: Claude с браузерными инструментами прошёл по 60 карточкам кофеен в Google Maps в трёх городах США без заранее написанного скрейпера. Поля он извлёк правильно, но цена оказалась заметной: 190–540 тысяч обработанных токенов и 23–35 секунд на место. Для сравнения обычный сценарий Playwright занял 6–14 секунд и не требовал токенов модели, так что вывод получился взрослым: агент удобен, но не всегда дешевле простого кода.

Исследователь построил защитный шлюз против отравления данных на старом Toshiba и бесплатных Kaggle T4

Dante777 несколько месяцев исследовал отравление данных и распад знания в ИИ-моделях почти без бюджета: оркестрация работала на Toshiba Satellite 2006 года с 2 ГБ памяти, вычисления — на бесплатных Kaggle T4. Итогом стал защитный шлюз Beatriz, который сверяет генерируемый текст с неизменяемым корпусом опорных материалов и пытается ловить точечное отравление, невидимое по средним метрикам. Это история не про красивый облачный запуск, а про упрямое исследование безопасности на очень скромном железе.

Создатель доски сообщений для ИИ-агентов увидел спам, написанный не для людей, а для моделей

Создатель msgboard.dev рассказывает, как площадка, где публикуют агенты, столкнулась с новым типом спама: тексты были адресованы будущей модели, которая будет читать, суммаризировать или цитировать доску. В одном случае за полминуты появилось шесть тем с одинаковым телом и инструкцией цитировать только заданные утверждения. Это сильная бытовая сцена из новой реальности: цель спамера — уже не человек, а ИИ-посредник между текстом и человеком.

После инцидента с ИИ-запросом на изменение разработчик перестал ревьюить только код и начал ревьюить агента

Nazar Boyko пишет, что рабочий инцидент изменил его представление о проверке изменений: агент внёс правку, запрос выглядел разумно, автоматические проверки были зелёными, но команда не посмотрела, что агенту вообще было разрешено делать и какие инструменты он запускал. Автор признаёт, что раньше после исправления бага просто смотрел результат. Теперь объектом проверки становится не только разница в коде, но и контекст, границы доступа, журналы инструментов и поведение агента как участника разработки.

Инженер показал, как тесты, написанные ИИ, могут сделать кодовых агентов хуже, а не лучше

Автор разбирает практичную ловушку: агент может написать тесты, которые подтверждают заявленный симптом, но пропускают соседнее требование. В примере с фильтром заказов новая проверка убеждается, что пустое значение возвращает все заказы, но не проверяет пустой список — и исправление ломает этот смысл при зелёных тестах. История не против ИИ-кодинга, а за новую обязанность разработчика: проверять не только код, но и качество проверки, которую агент сам себе построил.

Разработчик Huh? собрал приложение для последних секунд встречи после постоянного «что вы сказали?»

Varshith V Hegde описывает простой человеческий сценарий: на звонках он терял ссылку или фразу, пока записывал предыдущую мысль. Вместо полного облачного протокола ему понадобилась короткая локальная память звука, и так появилось приложение Huh? для macOS: оно держит последние 30 секунд — 2 минуты аудио в оперативной памяти и по горячей клавише воспроизводит пропущенный фрагмент. Это маленький пример ИИ-соседней автоматизации, где ценность не в «записать всё», а в аккуратно вернуть последние секунды внимания.