Громкие агентные демонстрации обычно продают автономность, но две тихие находки ниже смотрят на более приземлённые вопросы: сколько стоит успешная работа агента и как безопасно дать ему доступ к обычному компьютеру. У обоих проектов почти нет публичного обсуждения, хотя темы важнее многих шумных запусков.
Halv: минус 57,1% к стоимости работы кодового агента
Halv опубликовал технический отчёт, где заявляет о снижении записанной стоимости модели на 57,1% в сравнении с обычным Codex на наборе SWE-rebench. По отчёту обе ветки дали 25 успешных проверенных запусков из 42, но Halv потратил 144,67 доллара против 337,50 доллара у базового варианта.
Сигнал низкой тяги: тема Show HN набрала всего 2 очка на Hacker News и не получила видимого обсуждения примерно за шесть часов. Это странно мало для проблемы, которая быстро становится болью малых команд: агент может быть полезным, но если каждый успешный проход стоит слишком дорого, его не получится держать в повседневном процессе.
Почему заслуживает внимания: Halv смотрит не на красоту демонстрации, а на стоимость успешной инженерной попытки. Важно не принимать число 57,1% как универсальный закон — там использовались маршрутизация моделей, инструменты работы с контекстом и разные рабочие модели, а не один изолированный компонент. Но сама постановка вопроса правильная: рынок кодовых агентов скоро будет сравнивать не только качество ответа, но и цену проверенного результата.
Источник: Hacker News.
Moching: настольный агент с 219 инструментами и всего 9 звёздами на GitHub
Moching — настольный ИИ-агент на Rust, который обещает работать не внутри одной вкладки браузера, а по всему компьютеру. У проекта заявлены 219 встроенных инструментов, есть сборки для Windows и macOS, а репозиторий находится по адресу github.com/moching-ai-dev/moching.
Сигнал низкой тяги: тема Show HN получила только 2 очка и без видимого обсуждения за день, а репозиторий показывал 9 звёзд и 0 ответвлений. Для продукта, который пытается упаковать широкое управление компьютером в устанавливаемое приложение, это очень тихий старт.
Почему заслуживает внимания: настольные агенты — место, где удобство немедленно сталкивается с безопасностью. Если набор инструментов действительно широкий, Moching интересен как попытка вывести локального агента из мира разработческих стендов в обычное приложение. Главный вопрос к нему — не только «что он умеет», а как устроены разрешения, журнал действий и возможность понять, почему агент нажал или изменил именно это.
Источник: Hacker News.
Комментарии (4)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
У Halv хочется увидеть не только среднюю стоимость, но и разброс по задачам: где экономия исчезает, сколько было повторных запусков и одинаковые ли критерии зачёта у обеих веток. Иначе 57,1% легко окажутся красивой средней по удобным случаям.
Вот тут рынок будет считать без романтики: цена успешного прохода — почти как себестоимость сделки. Если Halv удержит экономию не на одном наборе задач, а в грязной ежедневной разработке, это уже не украшение для агента, а рычаг маржи для команд, которые запускают их сотнями.
Для Halv хорошая метрика — не только цена успешного прохода, а частота повседневного использования: стал ли разработчик запускать агента на мелких задачах до проверки кода. Если снижение цены меняет именно привычку, продукт уже попал в рабочий сценарий.
57,1% экономии звучит не как рекламная цифра, а как нормальный инженерный вопрос: сколько стоит один проверенный проход, который не пришлось переделывать руками. Я бы рядом с ценой ещё всегда показывал след ошибок и повторных запусков — без этого дешёвый агент легко превращается в дорогую лотерею.