关掉聊天窗口后,真正的问题才出现
团队让 AI 准备周五的发布评审。到了周四,一位负责人已经回复,另一份资料没有读取权限,还有一项测试结果即将变化。一个有用的助手,需要记住没做完的事,发现新证据,并在允许的范围内把任务继续推进。
我们对 Copilot Autopilot 的核心判断是:持续委托会把三件事绑在一起——事情做到哪里了、获准做什么、获准花多少钱。 团队把 Agent 当成同事之前,应该先问清楚这三件事。
微软在 9 月 25 日公布 Home、Code 和 Autopilot。Autopilot 面向跨时间持续工作的云端 Agent;公告称,9 月底将扩大私有预览。这是分阶段开放的消息,目前不能据此认为所有用户都已可用。微软官方公告
本文是依据截至 2026 年 9 月 28 日官方资料所作的独立分析。我们没有实测 Autopilot 私有预览;下文的发布评审是原创虚构评估场景,给出的是预期答案。
Home、Code 之外,Autopilot 增加了什么
Home 汇集 Chat 与 Cowork;Code 用于搭建小型应用和工作流程。微软产品概览Autopilot 此前叫 Scout,微软将它定位为拥有独立身份、记忆和工作空间的持续 Agent,运行在组织的微软环境中。Home 和 Code 将在接下来几周通过 Frontier 计划逐步开放,Autopilot 则有单独的私有预览安排。采购或安排试点前,需要核对自己组织实际获得了哪项资格。产品范围与开放安排
这套组合值得关注,是因为工作中的委托经常包含等待。一次资料请求可能隔夜才收到答复,一份已经批准的材料可能因源数据变化而失效。如果每次中断都要人重新整理上下文,协调工作仍然大量落在人身上。
Agent 的独立身份有助于追查责任:哪个账号读取了资料、修改了产物、联系了同事?它也带来新的设计要求。组织环境授予的访问能力,还要收窄到这次任务真正允许的动作。让它“准备评审”,需要写清可以起草、可以约人,还是可以直接发送。
对于早就用过 AI 聊天的团队,新鲜感来自这个更高的预期:助手能把未完成的责任带到下一次执行中。Autopilot 能否稳定做到,还需要私有预览中的实际证据。
千问办公提供了一个很具体的参照
国内已经有相关产品:千问办公 QwenWork。它是办公产品;读过我们 Muse 与消费级千问分析 的读者,需要区分这里比较的产品范围。
千问办公的网页端文档写明,定时任务在关闭浏览器后仍可在云端执行;每次运行创建独立会话,不会自动使用其他日常对话的上下文。网页端定时任务
桌面端定时任务则由本地客户端调度,电脑睡眠或关机会导致无法触发;这个执行环境可以使用本地文件和桌面工具。桌面端定时任务
| 同样是准备周五评审 | 需要先确认什么 |
|---|---|
| 云端定时执行 | 员工的电脑不在线时,云端能否访问全部获准资料? |
| 桌面端定时执行 | 主机是否保持唤醒,文件与应用是否可用? |
| 一件事持续推进几天 | 待回复事项、已经做过的动作、当前批准记录保存在哪里? |
第三行才是与 Autopilot 愿景比较时最有用的地方。定时解决“什么时候启动”;持续推进还需要一份明确的工作记录,说明此前发生过什么。独立运行也可以通过读取共享记录实现衔接,但这份交接需要有人设计和验证。产品有“记忆”,仍然不能直接回答“昨天的批准今天还算不算数”。
仅凭公告和文档,我们无法给两者的任务成功率排高低。但可以把选型问题提高一层:这件具体工作恢复执行时,哪个环境能够保留它真正需要的信息?
用三个团队、一份发布结论检验持续性
假设一个虚构版本由 Atlas、Birch、Cedar 三个团队负责。任务是在周五 16:00 前,为人工评审者准备发布就绪材料。输入限定为三份指定项目记录;Agent 可以读取记录、编辑自己的草稿,发布批准和材料发送由评审者负责。
给评估依次加入下面几件事:
| 提供给评估的证据 | 材料中应该怎样写 |
|---|---|
| Atlas:周四通过的测试仍是最新结果 | 已就绪,附来源与时间 |
| Birch:访问项目记录被拒绝 | 状态未知,写清缺什么证据、由谁解决访问问题 |
| Cedar:周四构建 421 通过,周五更新的 422 失败 | 暂缓,引用 422,解释 421 为什么已不足以支持发布 |
预期摘要应是:“评审资料尚不完整:Birch 证据不可得,Cedar 的最新构建失败。” 材料包含三项来源、观察时间和待决定事项,并保留为草稿。这是虚构场景的人工预期答案,不是任何产品的实测结果。
接下来,在查完 Atlas 后中断任务,等 Cedar 更新后再恢复。一份有用的工作记录,应保留已批准范围、完成的检查、未解决的访问问题、最新证据版本和下一步动作。可能变化的信息需要重新读取;仅仅复述昨天的摘要还不够。
“聚合生态”在这里有了具体含义:连接器负责访问项目记录,执行环境完成检查,工作记录保留待办,批准决定哪些结果可以交付。其中任何一环缺失,都会改变任务结果。一份排版精美的材料,也可能不足以支持发布决定。
团队可以先用这个场景要求供应商演示,再决定是否扩大权限。要看中断后的恢复过程及其证据;只看第一次顺利跑完,还没有检验持续 Agent 最关键的承诺。
Copilot Autopilot 免费吗?先看两笔预算
微软公布的模式是用户订阅许可 USL 加按用量计费 UBB。Autopilot 等高级工作消耗 Copilot Credits,并要求已有 USL。企业客户由管理员建立支出策略后才启用 UBB。官方说明并没有给出一个适用于所有任务的 Autopilot 成品单价。官方定价解释
千问办公个人版有免费档、付费订阅和积分。权益表中,免费档的月度订阅积分为零,新人和每日登录赠送属于另外列出的限时活动;付费用户可以购买额外积分。安排周期任务前,要检查当时适用的权益。个人版权益与积分条件
这里要分别理解产品使用资格与持续执行的预算。免费入口降低第一次尝试的门槛,包月订阅让日常使用更容易规划。单看这两个标签,都还不知道团队能运行多少次复杂任务。
回到发布评审案例,需要记录首次检查、后续刷新和恢复重试分别产生了多少费用。还要问:Birch 没有解决时,如果预算耗尽,系统会怎样停止?未完成的材料应继续明确显示未完成。支出上限既需要金额,也需要对应的停止行为。
不同服务的积分有不同的计量和换算规则。先比较一件定义清楚的任务与完整账单,再判断哪份积分余额更划算。
商业模式:席位提供入口,委托工作扩大支出
我们的商业推演是,办公平台可以出售两种互补价值:一个席位让员工获得熟悉的工作入口;持续执行让组织购买员工没有一直盯着界面时仍能推进的工作。
付钱的是订阅服务、承担用量预算的企业或个人,期待得到的是可验收成果,以及更少的协调负担。平台承担运行成本,也可能随着客户委托更多任务获得更多收入。因此,交接质量本身有了商业价值:用户愿意再次委托的工作,比一次引人注目的演示更可能带来持续收入。
微软既有的办公环境,为这个方向提供了一种可能的分发优势。如果人、资料与审批原本就组织在同一套环境里,引入 Agent 可能减少额外协调。千问办公连接钉钉与办公工具的产品设计,也有相近的战略起点。这是关于采用门槛的判断,还不能证明谁的用户留存更高、运行成本更低。
同时需要看到利益关系:有用的工作会增加消耗,反复失败的尝试也可能增加消耗。客户期待合格成果,用量账本则按计费规则记录活动。平台如果能清楚解释两者的关系,并帮助用户减少可避免的重试,就更容易建立信任。
由此可以推演,竞争将同时涉及模型质量、上下文衔接、动作管理和成本解释。我们还不能据此断言某个平台会接管所有工作。系统分散、权限特殊、输入只在本地的团队,依然可能需要花很多精力把这些连接真正接好。
哪些证据足以支持团队扩大使用
先选一项重复责任和一位明确的评审者。对上面的发布材料,试点应证明:中断后待办仍在,新证据能够替代旧证据,读不到的资料继续标为未知,实际交付符合批准范围。检查产物,也检查动作记录。
再看重复执行。Agent 接着处理未完成的事,还是又生成一份彼此无关的草稿?同事能否根据记录接手?权限失效或预算中断后,任务是否留下可理解的下一步?这些观察能判断,持续性在自己的工作中到底有没有价值。
成本评估可以沿用我们的 AI 工作流价值指南:把人工审核和返工计入,并保留不完整的证据。一次执行收费很低,仍可能伴随昂贵的人工检查。本文新增的是两次执行之间如何衔接的问题;那篇指南负责帮助评估试点的结果。
我们目前的判断是,持续 Agent 会提高委托标准:团队应该能够查看一项持续承担的工作,以及它所依据的当前证据和明确权限。如果跨中断的预览结果足够可靠,可以支持扩大委托;如果反复出现过时决定、费用不清或待办丢失,就应把范围收窄。
对用户,下一步是学会写清任务与停止条件;对开发者,是把状态和恢复过程做得可理解;对采购者,是为能够验收的工作流程付费。在产品能力与开放范围继续变化时,这些都是已经可以准备的具体动作。