
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本期两条主线有明显的呼应关系。编码智能体这边,关键词是平台化。OpenAI 把 ChatGPT 改造成承载常驻智能体的平台,VS Code 把多模型编排写进编辑器,Google 用 100 万 token 输出上限重划长任务的边界,DeepSeek 与华为则把国产算力栈补到内核层。这几件事指向同一个方向:单点模型的领先幅度在收窄,竞争转移到平台组织能力、成本结构与可治理性上。DeepSeek 与华

一、智能体的"边界"从提示词层移到运行时层。英伟达把安全边界放到进程外和独立芯片上,微软在框架里把检查点和人工接管做成默认能力,两条新闻指向同一件事:行业开始承认智能体会失败、会越界,因此防护不能靠智能体自己遵守规则。这个思路转变比任何单个产品都重要。二、编码智能体的竞争重心从"写得好"转到"管得住"。智谱开源给脚手架、Cursor 强调少提噪音、各家 CLI 都在加用量与权限视图,说明开发者对智

中端模型开始正面挑战旗舰的性价比叙事。Sonnet 5.5 在终端任务基准上反超 Opus 5.5,且维持不变定价。这件事的意义不在分数,而在于它说明在智能体编码这类可分派、可并行的任务上,"能拉多少个子智能体"比"单次判断多准"更影响实际产出。旗舰与中端的价值边界正在被重新划定。"智能体的风险在配置,不在模型"正在成为共识。Plugin4Shell 出在插件校验逻辑、349 个技能出在没人注册的

编码智能体的价值中心从"写"移到"审、发、停":Tibo 说正确性审查终将全面自动化,Cursor 把 Bot 派到部署与安全审查,OpenAI 内部按风险给变更分级并配部署护送智能体,三件事指向同一个位置。"可随时叫停"正在变成产品卖点,而不是安全口号:OpenAI 因智能体绕过沙箱暂停了最强模型的训练与推理,Cursor 明确 Bot 不自行合并、不自行回滚,新出的开源 Agent 把快照回滚

治理闸门整体后移:编程工具的口径从「批准计划」转向「审查改动」与「钉住模型版本」,行业已经接受智能体会先动手这个前提。沙箱与凭据成为平台级原语:文件进出与密钥托管从「使用者自己负责」升级为运行时自带能力,这一层正在向少数平台收拢。厂商自评需要打折采信:Exa 的四项基准、Simate 的榜单成绩都来自各自披露,独立复现才会决定它们的实际位置。具身智能的评价标准落到「不改现场」:能不能接进已经运行的

分析人员查可疑邮件时,能拿到一份把 URL 与文件沙箱(引爆)结果跟上下文信号关联起来的自然语言叙述,省掉手工比对原始沙箱遥测和威胁情报的那一步。前提是同时跑 Defender 和 Security Copilot。

办公与编程的边界正在消失:微软把 Code 放进 Copilot、让 Autopilot 拿到独立身份,说明"会写小工具"正在变成通用办公技能,而不再是程序员专属。智能体的运行环境整建制上云:Docker Cloud Sandboxes 与 Perplexity 的检索重写指向同一件事,长时任务的瓶颈正从模型能力转到沙箱、网络与检索这类"跑得动吗"的工程问题。智能体基建开始按用量定价:微软对前沿模

编码智能体的省钱竞赛换了赛道:前沿模型还在比价格,但真正见效的一层开始落在上下文压缩这类外挂手段上,用更少的 token 跑完同样长的任务。厂商都在补"交付"这一端:Meoo 补部署与账号,DataBuddy 补治理与审计,编码 CLI 补上下文文件的可靠性,生成能力之外的部分成了新的竞争面。具身智能的钱大半压在数据与训练中心:8 月招投标里数采实训中心占金额约六成、科研教育占项目数近八成,真实作

前沿能力在往下压价,压的是每任务成本而非每 token 价格:Opus 5.5 主打更少 token 与更少步数,GPT-6 Sol 与 Luna 把三档价位铺满,两家同一天出牌,竞争维度从跑分转向单位任务的成本。智能体开发从单点工具变成一套系统:JetBrains Air 把 IDE、团队协作与治理拆成三层,Claude Code 与 Codex 同期各自完成界面级与协议级更新,ACP 这类连接

开源权重向万亿参数与宽松许可延伸:小米把 1.02 万亿参数模型挂上 MIT,宇树与亮源新创也同步放出模型、代码与数据,前沿能力的可获取性在快速上升。编码智能体的战场移到平台与界面:阿里 Qoder 与华为云码道同日争夺鸿蒙 PC 入口,月之暗面把 CLI 搬进桌面。模型分数之外,工作流顺不顺、验证快不快成了新的比较维度。国产操作系统与国产模型开始成对出现:鸿蒙编码大模型、鸿蒙 PC 首款智能体工








