Agent 平台这两天的更新有一个共同点:厂商不再只讲模型能力,而是开始补运行时里的控制点。Google 给 Gemini API Managed Agents 加上 hooks、预算和定时触发;GitHub 在 JetBrains 插件里加入 OpenTelemetry、模型管理和自定义 agent;Vercel 让 Sandbox 可以从快照分叉,也让 Connect 绑定到自定义环境。
这些更新看起来分散,其实都在回答同一个问题:当 agent 能安装包、写文件、调工具、跑代码、请求 token 和接收 webhook 时,团队如何知道它做了什么,如何限制它能做什么,如何把一次成功的运行复制到另一个隔离环境。
这不是模型榜单的故事。真正的竞争点正在移到 agent 执行环境:hooks、遥测、预算、沙箱快照、环境级凭证和 webhook 入口。模型会继续迭代,但生产可用性越来越取决于这些看起来不那么兴奋的控制面。
hooks 把工具调用变成可拦截事件
Google 的 Managed Agents 现在默认使用 Gemini 3.6 Flash。更值得注意的是,它把 agent 放在一个隔离的云端 sandbox 中,让一次 API 调用协调推理、代码执行、包安装、文件管理和 web retrieval。新加的 environment hooks 可以在每次工具调用前后运行自定义脚本。
Google 给出的配置里,pre_tool_execution 可以匹配 code_execution 或 write_file,脚本如果返回 deny 决策,工具调用会被跳过,拒绝原因还会进入模型上下文;post_tool_execution 可以跑 lint 或自动格式化。换句话说,agent 不再只是发起工具调用,运行时也能把调用变成审计和阻断点。

Google 同时补了预算和自动化能力。max_total_tokens 可以给自治循环设总 token 上限,达到上限时交互以 incomplete 状态安全暂停,并保留环境状态;scheduled triggers 则把 agent、环境、提示词和 cron 绑定成持久资源,每次运行复用同一个 sandbox。这里的关键不是省钱,而是让长任务有停表、有状态、有调度边界。
IDE 里的 agent 也在接入治理接口
GitHub Copilot for JetBrains 的更新把同一个问题带回 IDE。它现在可以为 agent workflow 配置 OpenTelemetry export,让插件行为更容易对齐组织的可观测性要求;也能设置 BYOK 和自定义端点的默认 token 上限,并通过模型管理控件启用或停用内置 Copilot 模型。
对企业用户来说,这些功能比新增一个模型入口更现实。模型选择、token 上限、AI credits 展示、MCP diagnostics 和 session recording,都是把 agent 运行从个人体验推进到团队可管理流程里的细节。
这次更新还让 MCP servers 和 custom agents 进入 Claude agent flows。GitHub 的描述很直白:当团队需要专用工具、自定义指令或团队级 workflow 时,可以在 IDE 里复用这些配置,同时适应不同仓库。真正的变化是,IDE 开始承认 agent workflow 不是一次性聊天,而是一套要被记录、约束和迁移的工作流。
沙箱分叉把一次环境变成多条执行线
Vercel Sandbox 新增 Sandbox.fork(),从源 sandbox 当前快照分叉,并继承配置和环境变量。如果源 sandbox 正在运行,fork 使用最新保存状态,而不是 live in-memory state;没有快照时则按源 runtime 和配置重新创建。调用方可以覆盖传入参数。

这说明 agent 平台开始把实验复制、租户隔离和并行变体当成一等能力。一个共享 base 可以分叉给不同任务或租户,每条执行线保留自己的资源配置。对评测、修复、批量迁移和自动化 QA 来说,快照边界比一句「新建环境」更有操作意义。
Vercel Connect 的自定义环境更新补上了另一端:connector 可以绑定到 qa 之类的 Custom Environment,只有被链接的部署才能请求 provider token 或接收转发 webhook。Vercel 同时提醒,项目链接限制的是哪些部署能请求 token,token 一旦发出并不会自动做 provider 级隔离;如果需要更严格的隔离,就要为每个环境建单独 connector,并只申请必要 scope。
运行时控制会成为采购问题
这些更新放在一起,给团队的选型标准带来一个变化:不要只问 agent 用了什么模型,还要问它的工具调用能否预先阻断、失败是否保留状态、日志能否进现有可观测系统、token 和模型开关是否能按组织策略配置、环境和凭证是否能按项目或租户拆开。
如果这些问题答不上来,agent 再聪明也只能停留在个人助手层面。它可以帮人写代码,但很难被放进 CI、IDE、客户环境或带 webhook 的业务系统。下一轮平台竞争,大概率会发生在这些控制面上,而不是一句更大的上下文窗口。