AI 日报:Codex 使用激增,智能体工程走向执行与可观测
概览
近两日 AI 社区的讨论重点集中在三个方向:
- 编程智能体从“聊天式辅助”加速转向“可执行任务系统”;
- 开源模型通过量化与压缩继续推进本地部署能力;
- 多模态系统开始从静态理解走向实时感知、长视频推理与世界模型。
其中,OpenAI 的 Codex 与 ChatGPT Work 使用增长尤其受到关注。有公开发言称,Codex 与 ChatGPT Work 的使用量一周内增长了 2.5 倍;另有社区讨论称,Codex 活跃用户数可能在约一天内增加 100 万。相关说法仍主要来自社交平台公开信息与社区观察,需谨慎看待。
编程智能体:从对话走向执行
OpenAI 智能体产品需求快速上升
OpenAI 相关人员表示,Codex 与 ChatGPT Work 的使用量在一周内增长 2.5 倍,并称 GPT-5.6 Sol 的需求非常强,可能在基础设施扩容前带来一定服务压力。
围绕这一变化,开发者生态也出现了快速响应:
- JetBrains 将 Codex 列为推荐智能体;
- 有开发者强调 Codex 中相对低调的“问题工具”能力;
- OpenAI 开发者团队展示了使用 GPT-5.6 从头构建命令行评测工具的案例;
- OpenAI 还进行了多轮使用额度重置,引发社区用户关注。
这些信号表明,编程智能体正在从“代码建议工具”逐渐变成能够承担更完整开发流程的执行环境。
工具链、可观测性与评测环境变得关键
社区讨论的另一个共识是:模型能力本身已经不再是唯一差异点,智能体运行环境的质量正在成为竞争关键。
多个案例体现了这一趋势:
- 有开发者提醒,过时的
agents.md指令可能像“自我注入的提示攻击”一样,导致长任务卡顿数小时; - LangChain 为 Codex 增加了追踪能力,并将 LangSmith 的可观测范围扩展到 Cursor、Copilot、Pi 和 OpenCode,覆盖工具调用、子智能体与 token 使用情况;
- Hermes 更新了并行工具调用能力,并在 Hermes Agent 中展示了重置额度相关功能;
- 有观点认为,能够把自身业务价值编码进评测体系与运行环境的公司,可能比单纯依赖资本或模型规模的公司拥有更持久优势。
这意味着未来的智能体竞争不只是“谁的模型更强”,还包括谁能提供更可靠的任务编排、更清晰的调试方式和更贴近业务场景的评测环境。
开源模型:压缩、量化与本地推理
低比特模型推动本地部署
开源模型社区继续围绕极限压缩展开探索。
PrismML 发布了基于 Qwen 3.6 27B 的 Bonsai 27B,并提供两个紧凑版本:
- Ternary Bonsai 27B:约 5.9GB,等效 1.71 bit;
- 1-bit Bonsai 27B:约 3.9GB,等效 1.125 bit;
- 授权协议为 Apache 2.0。
相关发布强调,这些模型不仅体积较小,还试图保留多模态、工具调用、长上下文和智能体工作流能力。社区演示中,Hermes 在 RTX 5090 上运行了相关模型,也有移动端部署方向的展示。
腾讯混元也发布了 1-bit 与 4-bit Hy3,称其 295B 旗舰级模型可通过 llama.cpp 和 MTP 在单张 GPU 上服务。
量化拓宽开源模型使用边界
量化工具与本地推理方案也在持续扩展。社区中有人宣布为 Gemma-4 系列以及 Qwen3.5-122B-A10B、GLM-4.7-Flash 等模型提供 NVFP4 动态量化。
另有本地部署讨论提到,多节点 DGX Spark 配置可运行:
- 1M 上下文的 DeepSeek v4 Flash;
- MiMo-V2.5;
- 跨四节点部署的 GLM 5.2 NVFP4。
这些信息共同指向一个趋势:本地推理已不再只是实验性玩法。在低比特权重格式、优化推理框架和更成熟智能体工具链的配合下,本地模型开始进入更严肃的智能体工作流场景。
多模态系统:实时视觉、长视频与世界模型
实时多模态从“看完再答”走向持续感知
OpenMOSS 发布了 MOSS-VL-Realtime,这是一个 11B 视觉语言模型家族,采用 Apache 2.0 协议,支持 256K 上下文,面向连续视频流。
其核心特性包括:
- 在生成回答时继续观看视频流;
- 随着场景变化修正或打断回答;
- 在证据不足时保持沉默;
- 面向离线、流式与实时场景使用统一模板。
技术讨论中还提到,该系统采用跨注意力架构,并使用 XRoPE 统一时间与空间位置表达。
这类能力意味着多模态模型正在从“输入一段图像或视频后回答问题”,走向更接近人类观察方式的持续感知。
长视频理解转向主动证据搜索
长视频理解也出现了从“被动读取帧”向“主动寻找证据”的变化。
社区总结提到 OmniAgent,该系统基于 Qwen2.5-Omni-7B,采用 Observation–Thought–Action 循环,让模型只请求自己需要的画面帧或音频片段。
相关结果显示:
- OmniAgent-7B 在 LVBench 上得分 50.5;
- Qwen2.5-VL-72B 得分为 47.3;
- OmniAgent 消耗约 203 帧,而对比方案消耗约 768 帧。
训练方法方面,相关讨论称,被动监督微调反而会损害表现,而 5.8 万条智能体轨迹以及基于 TAURA 的熵加权强化学习带来了改进。
这一方向的关键变化在于:视频理解不再只是把更多帧塞进上下文,而是让模型主动决定“该看哪里、该听什么、何时停止”。
世界模型向更长时域模拟推进
世界模型方向也出现了新的工程讨论。有团队介绍了全模态世界模型的数据栈,强调需要 PB 级视频数据、六个流水线阶段,以及数据质量提升在“生成视频”和“理解视频”两端带来的双重收益。
从这些讨论看,视频、运动和交互正在被视为不同于静态图像的新型数据类型。要让模型理解现实世界,仅靠把视频拆成一系列图片可能并不充分,还需要专门的数据采集、基础设施和建模方式。
小结
本轮 AI 社区动态中,值得关注的不是单个产品更新,而是几条主线的同时推进:
- 编程智能体正在承担更完整的软件工程任务;
- 工具链、评测、可观测性和运行环境成为智能体产品的核心竞争层;
- 低比特量化和模型压缩让本地推理能力继续增强;
- 实时多模态、长视频主动推理与世界模型正在成为下一阶段研究重点。
这些变化共同说明,AI 系统的竞争正在从单点模型能力,转向模型、工具、环境、数据和工作流的综合工程能力。
