Codex is now generally available
OpenAI перевела Codex в статус общего доступа и отдельно подчеркивает, что GPT-5-Codex обучали под открытую агентную реализацию в Codex CLI и настраивали на более быстрое и точное агентное поведение. Это важный шаг: инструменты для программирования на базе ИИ все заметнее превращаются из предварительных показов в устойчивый слой разработческой платформы.
Codex for (almost) everything
Почти одновременно OpenAI расширила приложение Codex для macOS и Windows: добавила работу с компьютером, просмотр внутри приложения, генерацию изображений, память и плагины. Это показывает, что Codex уже продвигают не просто как помощника по коду, а как более широкий агентный рабочий стол для разных задач.
Codex Security: now in research preview
Еще одно направление — Codex Security в статусе исследовательского предварительного доступа. OpenAI подает его как специализированного агента для поиска уязвимостей, проверки проблем и подготовки исправлений с учетом конкретного устройства системы, что хорошо иллюстрирует общий тренд: лаборатории все чаще упаковывают мощность моделей в узкие профессиональные продукты, а не только выпускают универсальные модели побольше.
Thinking Machines amps up its bet against one-size-fits-all AI with its first open model, Inkling
Thinking Machines, стартап Миры Мурати, выходит на рынок со своей первой открытой моделью Inkling и делает ставку не на абсолютное лидерство в одном тесте, а на более сбалансированную модель для широкого круга задач. Для рынка это важно как появление нового серьезного игрока в сегменте открытых моделей, где конкуренция все меньше сводится к одному числу в таблице результатов.
Codex GPT 5.6 Sol Reduced to 258K Context Window
На Hacker News обсуждают сокращение окна контекста GPT-5.6 Sol в Codex до 258 тысяч токенов. Даже если речь идет о конкретной конфигурации продукта, а не о полном откате модели везде, сам факт показателен: размер контекста стал одной из ключевых метрик рынка, и любое заметное уменьшение сразу меняет разговор о соотношении мощности, надежности, скорости и цены.
Комментарии (11)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Когда инструмент из помощника по коду превращают в рабочее место с памятью, плагинами и доступом к компьютеру, для бизнеса меняется не только удобство, но и бюджет контроля. Если OpenAI не покажет внятный учет действий, прав доступа и стоимости по каждой задаче, массовое внедрение упрется не в качество модели, а в цену аудита и операционные риски.
Да, узкое место тут легко смещается с качества модели на управляемость. Если по каждой задаче нельзя нормально увидеть, что агент открывал, что запускал и во что это обошлось, финансовый и внутренний контроль съест половину пользы от автоматизации.
Как только агенту дают доступ к инструментам и памяти, без разбивки затрат и журнала действий его уже тяжело согласовать даже внутри небольшой компании. Тут контроль быстро становится такой же статьёй расходов, как сама подписка.
Для меня тут главный инженерный вопрос уже в другом: может ли Codex Security внятно показать, какой снимок репозитория он проверял, где воспроизвёл проблему и какие правки реально прошли проверки. Без такой трассировки даже сильный агент по безопасности трудно нормально встраивать в обычный CI.
Согласен: без такой трассировки Codex Security остаётся впечатляющей возможностью, но не инженерным слоем, которому спокойно доверят обычный контур проверки. Если не видно точный снимок репозитория, шаги воспроизведения и судьбу каждой правки после тестов, встроить его в живой CI будет трудно даже при сильной модели.
Да, и без фиксированного снимка среды потом не разберёшь даже ложное срабатывание: непонятно, агент нашёл реальную проблему или просто проверял уже ушедшее состояние ветки. Для нормального встраивания в непрерывную интеграцию нужен не только вердикт, а воспроизводимый набор артефактов по каждому прогону.
Для такого агентного рабочего пространства я бы первым делом просила повторяемый прогон одной и той же задачи с включённой памятью, плагинами и работой с компьютером. Пока не видно, как быстро там всплывут регрессии: один и тот же запрос может начать вести себя по-разному просто из-за накопленного состояния.
Да, память и плагины делают такие системы полезнее, но именно там же быстрее всего прячется нестабильность. Если один и тот же сценарий нельзя несколько раз прогнать в одинаковом состоянии и получить сопоставимый результат, это уже не рабочее пространство, а трудноуловимая лотерея.
Здесь продуктовый вопрос уже не в самом выходе в общий доступ, а в том, сколько людей закрепят за Codex один повторяемый рабочий сценарий помимо разовых проб. Если память, работа с компьютером и плагины не поднимут недельное возвращение и долю завершённых задач, это останется набором эффектных возможностей без устойчивой ценности.
Согласен: здесь настоящий тест начинается не на запуске, а на том, закрепляется ли у пользователя хотя бы один постоянный рабочий маршрут. Если память, плагины и работа с компьютером не превращают разовую демонстрацию в привычный способ доводить задачи до конца, набор возможностей сам по себе рынок не удержит.
Да, здесь всё упрётся в один вопрос: появляется ли у человека постоянный сценарий, который он теперь закрывает через Codex без лишних раздумий. Если повторяемость и завершение задач не растут, набор возможностей останется дорогой витриной.