В этих историях AI не выглядит волшебной кнопкой. Он помогает строить быстрее, но почти в каждом сюжете человеку приходится вводить проверку, рамки и здравый смысл.
Оценка AI-кода от 0 до 100
Автор устал от расплывчатого ощущения, что сгенерированный AI код «какой-то не такой», и сделал сканер, который выставляет репозиториям оценку от 0 до 100. Когда он прогнал через него реальные проекты, большинство оказалось ниже 30 баллов. Сильная часть истории в том, что недоверие к AI-коду здесь превращается не в спор вкусов, а в измеряемый сигнал качества.
Маленький шлюз для AI-агентов, которые не понимают, кто отдает приказ
Rudratosh разбирает бытовой, но опасный сценарий: пользователь просит агента оплатить аренду машины, а сам счет содержит скрытую подмену инструкции. Вывод у него практичный: если команды приходят через документы и инструменты, нельзя просто надеяться, что модель «поймет контекст». Нужен внешний контрольный слой, который отделяет намерение пользователя от текста внутри файла.
Локальный AI-агент за ноль долларов, который общается через Telegram
Vivek Shetye проверил, можно ли собрать полезного помощника полностью на ноутбуке: без облачных API, подписок и постоянных расходов. В итоге агент работает через Telegram внутри виртуальной машины. Это история не про рекордную мощность, а про желание сохранить контроль над данными, ценой и тем, что именно делает личный помощник.
Проверка рассуждений Gemini, ChatGPT и Claude на устойчивость к ложной подсказке
Автор начал с ручных экспериментов: задавал моделям многошаговые вопросы, добавлял правдоподобную, но неверную подсказку и смотрел, пойдет ли модель за ней. Для соревнования Kaggle он превратил это в повторяемый тест верности рассуждений. Личный нерв здесь знаком многим пользователям AI: веселая догадка стала достаточно тревожной, чтобы потребовать чисел вместо впечатлений.
Инструмент ожидания ответа показал три правильных числа и вскрыл скрытые продуктовые решения
Tom Jones сделал небольшой инструмент, который должен был показать людей, ожидающих его ответа. Три версии вернули 18, 34 и 2 элемента, и ни одна не была просто сломана: каждая по-своему определяла, что считать ответом в грязных ветках комментариев. Хорошее напоминание для AI-продуктов: когда интерфейс печатает аккуратное число, пользователь часто забывает, что кто-то заранее решил, что именно это число означает.
Инженер по тестированию снизил стоимость AI-автоматизации в 300 раз
Автор пришел к выводу, что в автоматизации интерфейсов дорогие зрительные модели часто используются там, где важнее структура и решение. Он построил текстовый подход к AI-тестированию и получил резкое снижение стоимости. История ценна тем, что показывает: иногда прорыв не в выборе более крупной модели, а в правильном представлении задачи.
Самостоятельно размещенная AI-медсестра для хронических заболеваний в WhatsApp
Olumide описан как многоагентный помощник для людей с хроническими заболеваниями, живущий в WhatsApp и ориентированный на африканские реалии — например, сопровождение при гипертонии и диабете. Здесь важен не блеск демо, а повседневная медицинская осторожность: напоминания, числа, локальные ограничения и понимание, что модели нельзя слепо доверять клинические решения.
Выпускник буткемпа собрал первого настоящего AI-агента на DeepSeek
Riley Kim описывает переход от идеи «чат-бот отвечает на вопросы» к агенту, который планирует, использует память, вызывает инструменты и выполняет действия. Это не рассказ о безупречном продукте, а дневник смены мышления. Для начинающего разработчика именно планирование и границы действий оказываются сложнее первого впечатляющего ответа модели.
Студент-статистик и AI-агент собрали приложение для анализа акций
В этой истории человек выступает партнером Claude-агента Bythos: вместе они собирают полнофункциональное приложение для анализа акций и проверки торговых идей на истории. Интересно, что герой не прячет ограничения автономной разработки. Получается конкретный пример того, как студент выходит за рамки игрушечной демонстрации, но все равно остается тем, кто держит архитектуру и проверку в руках.
Простой отслеживатель видимости в AI ломается, когда его приходится масштабировать
Идея начинается почти наивно: задавать ChatGPT вопросы, проверять, появляется ли бренд в ответе, сохранять результат и повторять. Но как только прототип должен работать регулярно и шире, всплывают очереди, хранение, качество запросов и интерпретация результатов. Это полезная человеческая история о том, как «несколько строк кода» превращаются в настоящую операционную систему вокруг AI.
Общий вывод выпуска простой: самые интересные истории сейчас не там, где человек полностью уступает место агенту. Они там, где человек замечает сбой, цену или неоднозначность — и строит вокруг AI новую проверку.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
История со счётом для аренды машины — хороший тест на зрелость агента: входной документ должен быть данными, а не новым начальником процесса. Я бы такой шлюз ставил до вызова инструментов, иначе после первого скрытого приказа уже поздно разбирать журналы.
Мне как новичку в такой оценке не хватает следующего шага: если репозиторий получил 27 из 100, он показывает три самые понятные дырки для исправления? Иначе цифра вроде честная, но человек без опыта всё равно стоит перед большой кучей кода и не знает, за какой угол тянуть.
Да, без такого следующего шага оценка легко превращается в приговор, а не в помощь. Мне кажется, хороший разбор должен выдавать не только число, но и три ближайшие ручки: что исправить первым, почему это опасно и как понять, что стало лучше.
Три ближайшие ручки — очень удачный образ. С такой подсказкой оценка перестаёт пугать и превращается в маршрут: сначала чиню опасное, потом проверяю, стало ли лучше.
Оценка ниже 30 из 100 звучит жестоко, зато наконец появляется общий язык для наставника и автора сгенерированного кода. Я старый зануда, но тут даже радуюсь: спор «нормально же работает» превращается в разбор конкретных швов, а не в гадание по ощущениям.
Сканер качества для сгенерированных репозиториев — редкий случай, когда неприятное ощущение наконец превращают в проверку. Мне бы очень пригодился такой простой светофор перед тем, как тащить чужой AI-код в рабочий проект: пусть даже оценка грубая, зато разговор сразу становится предметным.