Future AGI выглядит как платформа для команд, которые уже выводят ИИ-агентов в рабочую среду и устали склеивать оценки, защитные правила, наблюдение и маршрутизацию моделей из разных инструментов. Главный вопрос — окупит ли единая обвязка сложность внедрения.
Сегодня в подборке три удалённые вакансии из RemoteOK: оценка ответов ИИ по изображениям в iMerit, коммуникации по безопасности ИИ в NOPE и инженер данных для API в Benzinga. Две позиции скорее контрактные и гибкие, третья требует показать сильный технический проект.
DataAnnotation.tech ищет удалённых специалистов для создания и проверки подсказок: можно работать полный или неполный день, обучение обещают на старте. Это не классическая инженерная позиция, а гибкий вход в оценку моделей и качество ответов ИИ.
Главная новость выпуска — опыт Hugging Face с малой моделью на 350 млн параметров: её дообучили лучше выдавать структурированные ответы всего за 100 шагов. Рядом — NeoMME, браузерные ускорители для локального ИИ, расширение открытого рейтинга распознавания речи и новые подходы к памяти агентов.
Стартап Koliseum предлагает редкую для рынка идею: проверять AI-модели не на заранее известных наборах задач, а в живых сценариях, где результат можно сверить только после наступления реального события. При этом внимания у запуска почти нет — на странице Launch YC у проекта был всего 1 голос, хотя сама ставка выглядит намного сильнее цифры.
Свежая подборка из arXiv показывает сразу два сильных направления: медицинские работы всё жёстче проверяют реальные ошибки AI-систем в клинических заметках и оценке заметок, а исследовательские команды параллельно строят новые стенды и тесты для проверки того, умеют ли AI-агенты действительно заниматься наукой, а не просто угадывать ответы.
За последние дни в международном YouTube особенно заметны пять сильных видео об ИИ: подробный практический гид по Claude, большой разговор о контроле самоускоряющегося ИИ, разбор корпоративного внедрения от Microsoft, прикладное видео про оценку систем с большими языковыми моделями и интервью о том, почему инвесторы всё ещё готовы ставить на OpenAI при огромной оценке.
Пять свежих находок с низкой видимостью: gnt предлагает хранить правила для ИИ-агентов прямо в репозитории, Double пытается автоматизировать поиск работы как личный агент, ai-agent-eval-framework даёт лёгкий каркас для проверки поведения агентов, AG собирает надёжность и самовосстановление в одном рантайме, а Alfa предлагает необычный способ борьбы с галлюцинациями через прогнозирование и резонанс.
В рейтинге Document Arena модель Claude Opus 4.8 (Thinking) заняла 10-е место с результатом 1477. Это не смена лидера, но важный сдвиг: у версии 4.8 появилось подтверждённое место в верхней десятке именно по работе с документами, а не только заметность на соседних бенчмарках.