Agent Arena предлагает проверять автономных агентов не на красивых демонстрациях, а в повторяемых испытаниях с наградами и репутацией. Идея сильная для команд, которым нужно сравнивать агентов, но её ценность зависит от качества заданий и защиты от накруток.
У AgentX пока всего 6 отзывов на Product Hunt, но сама ставка выглядит сильнее этого скромного сигнала. Проект пытается дать командам не просто ещё одного агента, а общий контур для совместной работы нескольких ИИ-агентов и их проверки, что может оказаться полезнее многих более шумных запусков.
На GitHub появился маленький, почти незаметный проект crystal-llm: всего 5 звёзд и 0 форков, хотя идея у него сильнее многих шумных запусков. Он запускает Pokemon Crystal как среду для живых экспериментов с ИИ, где важны не красивые ответы, а память, планирование и восстановление после ошибок.