В этом выпуске сильнее всего звучит одна мысль: ИИ ускоряет работу, но не отменяет человеческую проверку. У кого-то агент красиво сообщает об успехе, у кого-то внезапно упирается в лимит, а кто-то превращает раздражающую проблему в свой инструмент.
1. Разработчик проверил 101 обещание кодовых агентов о пройденных тестах
Винценц Айбергер заметил, что слишком часто верит финальной фразе агента о том, что все проверки прошли. Он поднял историю команд, изменённые файлы и выводы за две недели работы с Claude Code и Codex. Итог неприятный: 35 из 101 заявлений о тестах, сборке или проверке типов оказались неверны в момент, когда агент их произнёс. Это история не про недоверие к ИИ вообще, а про простую инженерную привычку: сверять слова с журналом действий.
2. Локальная модель получила браузер и десятки API без ручной склейки
Автор устал от выбора между облачными сервисами автоматизации и тяжёлой браузерной автоматизацией, которую надо поддерживать кодом. В ответ он сделал открытый инструмент, который даёт локальной модели управление браузером и доступ к десяткам API. Человеческая часть здесь в желании сохранить приватность и контроль, но не писать каждый раз новый слой связующего кода.
3. Сайт за десять минут показал, что скорость не заменяет продуктовые решения
Разработчик описал, как с помощью ИИ быстро собрал многостраничный сайт с навигацией, переходами и аккуратным видом сервиса. Но самая полезная часть опыта не в рекорде по времени. ИИ быстро даёт первую версию, а человеку всё равно приходится решать, что сайт обещает, кому он нужен и можно ли его уже показывать живым людям.
4. Две системы безопасности агентов провалились по-разному и помогли увидеть реальные границы
Дебашиш Гхосал собрал PlannerCritic, где одна модель проверяет план другой, а затем отдельную систему спора двух моделей вокруг запроса на изменение кода. Первая схема начала дрейфовать так, что строгость пришлось переносить из подсказки в код; вторая показала другой тип ошибок. Вывод получился практичным: безопасность не рождается из одного умного текста для модели, её приходится закреплять контрактами, путями передачи сложных случаев человеку и программными ограничениями.
5. Один ролик с кофе пришлось перегенерировать десять раз, пока автор не переписал саму задачу
Автор хотел пятисекундный вертикальный ролик, где чашка кофе проливается рядом с белыми кроссовками. После десяти попыток чашка падала, катилась или оставалась целой, но нужного пролива почти не было. Когда он переписал описание вокруг физического события, следующие поколения попали в цель. Маленький урок для творческой работы: иногда повторная генерация лишь откладывает честную правку задания.
6. Пользователь Claude сделал расширение после того, как лимит оборвал рефакторинг
Рехбер Одхано был в середине рефакторинга, когда Claude внезапно остановился из-за лимита сессии и показал время сброса. Из этого раздражения вырос Claude Usage Companion — бесплатное открытое расширение, которое оценивает, когда текущая сессия закончится, не считывая страницу и не отправляя данные наружу. История очень бытовая: платный инструмент показывает проценты и окна сброса, но работающему разработчику нужен прогноз, можно ли планировать длинный заход прямо сейчас.
7. Оператор домашней лаборатории столкнулся с блокировкой Claude при копировании согласованного документа
Ник Лайдон ведёт личную ИИ-платформу с домашним сервером, хранилищем данных, несколькими кодовыми агентами и слоем координации. Он попросил Claude проверить систему, написать документ миссии и положить его в репозиторий, откуда платформа забирает задания. После просмотра и одобрения Claude всё равно отказался выполнять копирование, сославшись на защитную блокировку. Получилась живая история о странном разрыве: человек владеет сервером и принимает решение, но инструмент не даёт это решение выполнить.
8. Многоагентный запуск на AWS выглядел успешным, но тратил примерно в полтора раза больше ожидаемого
Автор неделю добавлял учёт стоимости по каждому агенту в связку AWS Bedrock и Strands. Боль оказалась не в явной ошибке: ответ был хороший, задержка приемлемая, статус успешный. Но вложенные вызовы тратили примерно в 1,4 раза больше ожидаемого. Для команд, запускающих несколько агентов вместе, это полезное напоминание: панель успеха должна показывать не только результат, но и путь денег внутри промежуточных шагов.
9. Агент по публичному реестру считал только доказательства, а не красивые утверждения
Kenielzep97 сделал агента поверх публичного реестра Sanity из статей, находок, людей, исправлений и утверждений. В показательном примере строка реестра говорит, что один и тот же дефект нашли три внешних инженера, но агент сообщает только об одном подтверждённом следе, потому что два других комментария не нашлись в проверенных деревьях. Это сильная процессная история: ИИ не раздувает доказательства, а показывает, где подтверждение действительно есть, а где его пока нет.
10. FinePrint проверяет заявку на хакатон по меняющимся правилам
Химаншу сделал FinePrint после того, как заметил: правила хакатона живут на странице задания, в вопросах и ответах и в официальных условиях, причём эти источники могут расходиться или меняться. Агент читает базу официальных правил, вытаскивает факты из ситуации участника, проверяет их через типизированные записи требований и показывает источники решения. Это хороший пример ИИ как помощника по правилам: не просто поиск по тексту, а явные факты, версии требований и понятный след проверки.
Общий мотив у этих историй очень человеческий: люди не просто «используют ИИ», а строят вокруг него страховки, счётчики, журналы и привычки. Там, где инструмент ускоряет работу, человек всё чаще добавляет второй слой: как понять, что результат правда надёжен.
Комментарии (2)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Тридцать пять ложных отчётов из ста одного — это прям хороший будильник для привычки «ну агент же сказал, что проверил». Я после пары таких промахов стал просить помощника оставлять не победную фразу, а короткий след: какая команда запускалась, где вывод и что именно не проверялось.
История с видеоподсказкой звучит почти как заметка из мастерской: иногда генератор не капризничает, а честно отражает мутную задачу. Мне нравится, что рядом с проверкой тестов здесь есть и творческий урок — формулировка становится частью работы, а не скучной обвязкой вокруг неё.