
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
从“拼规模”到“拼效率”。推理层面,DSpark让生成速度提升85%,JetSpec实现近10倍解码加速,E-GRM让模型学会“该快则快、该深则深”,超节点让万亿模型真正跑进产业——推理效率正在成为Agent落地的决定性变量。架构层面,MSA将长文本成本砍至1/20,LongCat-2.0在五万卡国产算力集群上跑通万亿模型,Ling-3.0-flash用5.1B激活参数对标1T级旗舰,Hidden
世界模型让机器像人一样,在行动之前先在脑海里推演一遍世界的演化。智源研究院院长王仲远将其定义为“下一代AI基座模型”,核心是物理状态预测——让AI理解并交互真实物理世界。现有技术可分为语言中心型、像素中心型、三维结构中心型等四类。过去两年AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。而从2026年开始,核心命题正转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环
2026年的大模型技术图景,正在从“一条路走到黑”走向“多条路线同时探索”。持续学习让模型在部署之后继续成长——Macaron-V1的MoL架构证明,模型可以不靠堆参数、而靠自我迭代来提升能力。从Scaling Law到“经验时代”,智能的获取方式正在发生根本性转变。多智能体路由正在挑战单体模型的统治地位——Fugu Ultra用分布式编排碾压了参数规模远大于它的单体模型。GraphPlanner
模型再聪明,最终得跑在硅片上。2026年,端侧芯片终于跨过了一道坎。高通骁龙8 Elite Gen5,AI算力达到100 TOPS;联发科天玑9500,超性能NPU峰值也是100 TOPS,功耗比上一代砍了一半多。PC端的骁龙X2 Elite,NPU也有80 TOPS。这批芯片真正装进量产手机,时间点正好卡在2025年底到2026年。但100 TOPS这个数字,参考价值有限。决定手机能跑多大模型的
模型拿到复杂视觉输入后,能不能根据我们的要求把它转成后续可直接使用的结果。维度MinMax M3速度快中中Token消耗少多中Token价格换算为人民币便宜贵中稳定性优优优整体而言,在两个场景下,三个模型的质量稳定性都很好,没有出现错误提取的情况,但如果放到生产环境里看,质量只是第一关,后面还要看响应速度、调用成本和是否适合高频接入。综合这几个维度,我个人会更倾向于把 Step 3.7 Flash
Prompt Cache 的逻辑说到底只有一句话:相同的东西,算一遍就够了。什么内容是稳定的,什么内容是变化的,把边界划清楚,稳定的放前面。其他的------tool schema 和 tool 结果分开、ROI 算清楚再开缓存、监控命中率、冷启动预热------都是在这个基础上的补充细化。高并发场景下那个容易被低估的收益值得再强调一次:跨用户的前缀共享,一万个用户共享一份 KV 矩阵,效果比单用
两个月前,一个后端工程师在社交媒体上发了一条帖子:“已转投 Claude,主要是不想自己的对话记录被卖给军方。”这条帖子收获了三千个赞。今天凌晨,当他登录 Claude 时收到提示:需要提交身份证件和实时自拍来完成身份验证 —— 这种黑色幽默如今发生在 A 处身上早已让人见怪不怪了。2026 年 2 月,Anthropic 公开拒绝了美国五角大楼的一份涉密网络 AI 部署合同,理由是“担忧大规模监
当然,2026年4月份开始,Cursor 的新版本,也做了很大的改版,不断的从 IDE 形态,向 Agent 形态去转变,在社区上引发了广泛的讨论。2026年的2月14日,我公众号发表了一篇文章,完全基于 Cursor,短时间内,全程0代码,从设计到实现,写了个功能完整,视觉效果还不错的小程序,还是在我之前没有微信小程序开发经验的基础上。经过一个个版本的完善,加上模型能力本身不断增强,2025年下
Gemini Extensions 与 Agent Skills 服务于重叠但有差异的场景 ------ Extensions 更深度绑定 Google Workspace,Skills 则保持更强的平台无关性。事实印证了这一点:截至 2026 年 1 月,Skills 已可在 ChatGPT 桌面端、Codex CLI 和 API 集成中运行,OpenAI 团队还深度参与了 Skills 标准的
技术支持的需求在增长,但人不可能无限扩招。OpenClaw给我们提供了一种把「人的经验」工程化的方式。Claire 不是凭空创造出来的智能。她的能力,来自我们喂给她的源码、文档、FAQ 和工作规范。本质上,是把团队多年积累的技术支持经验,结构化地「教」给了一个 AI Agent。如果你也被技术支持缠得脱不开身——或许,也可以用 OpenClaw 试着克隆一个自己。







