
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
世界模型:AI从信息处理迈向行动决策的关键突破 世界模型是AI领域的重要发展方向,它让AI能够在内部构建"世界如何运转"的认知框架,从而预测行动后果并做出决策。与擅长信息处理的大语言模型不同,世界模型聚焦于理解环境状态变化、行动影响和未来预测,是实现机器人、自动驾驶等物理AI应用的核心技术。 当前世界模型主要分为四类:隐空间模型(如Dreamer)、规划导向模型(如MuZero
DeepSeekV4的HybridAttention架构通过分层记忆系统解决了百万Token上下文的核心瓶颈问题。该系统采用三级结构:SlidingWindow保留最近128个Token的原始KV作为短期精确记忆;CSA(Compressed Sparse Attention)每4个Token压缩为一条KV并建立索引系统,形成可检索的中长期记忆;HCA(Heavily Compressed Att
是否发送优惠券发送哪一种优惠券优惠金额是多少是否购买订单金额订单利润是否复购用户留存发券前已经存在的用户特征目标是估计:它表示:对于特征为 (x) 的用户,发券和不发券之间的预期结果差异。读到这里,可以把全文压缩成三句话。第一句:CausalLM 通过因果掩码限制信息流方向,让模型只能根据过去 Token 预测未来 Token。第二句:因果推断研究的是,主动采取某个行动后,结果会产生怎样的增量变化
K3有2.8T参数,所以它很强。模型如何记得更长?模型如何堆得更深?AttnRes模型如何拥有更多参数,却不全部计算?Stable LatentMoE + 稀疏激活模型如何以低精度真正运行?MXFP4 + MXFP8 + 量化感知训练K3 的价值,不是证明“只要继续增加参数,模型就会自然变强”。它反而证明了一件更重要的事情:当模型进入万亿参数和百万上下文时代,单纯增加参数已经不够了。记忆如何组织信
Kimi K3 的开放,确实具有标志性意义。一个拥有 2.8T 参数、896 个专家、百万 Token 上下文、进入全球第一梯队的模型,其完整权重已经可以被开发者获取。但 K3 同时也证明了一件更现实的事:模型权重开放,不等于部署门槛消失。8 张 MI355X 可以让 K3 完成加载和正确性验证。模型能不能放进去?模型放进去以后能不能以合理的吞吐、延迟和成本运行?同样,四张 24GB 显卡的确可以
《KimiK3技术解析:重新设计大模型的信息调度方式》摘要 KimiK3模型通过创新架构设计解决了大模型发展的核心瓶颈问题。文章深入剖析了K3的四大核心技术:KDA(分层记忆系统)、AttnRes(深度网络信息检索)、MoE(超稀疏专家网络)和AgentHarness(长程任务管理)。不同于简单堆砌参数规模(2.8T参数,896专家),K3首创性地重构了Transformer内部的信息处理机制:通
Kimi K3技术解析:从万亿参数到系统工程革命 Kimi K3的2.8万亿参数引发关注,但其真正价值在于系统性解决四大核心挑战:百万级上下文的高效处理(KDA+GatedMLA混合注意力)、93层网络的深度信息保留(Attention Residuals)、万亿参数的稀疏激活(StableLatentMoE专家系统),以及持续数小时的Agent任务稳定性(长程RL+可恢复沙箱)。这套架构通过KD
大模型后训练正在发生一个很重要的变化。过去,我们经常用 SFT、普通知识蒸馏,让模型去模仿标准答案。这个思路很直观:给模型一个好答案,让它学会照着生成。但问题是,模型真正推理的时候,看到的不是标准答案的上下文,而是它自己一步步生成出来的上下文。一旦模型前面某一步走偏,后面就会进入训练时没见过的状态,最后越写越偏。OPD,也就是On-Policy Distillation,同策略蒸馏,解决的正是这个
要理解 OPD 的理论来源,必须先讲 GKD。GKD,全称 Generalized Knowledge Distillation,对应的论文是。这篇论文的重要性在于:它最早把“语言模型蒸馏”明确放到了 imitation learning 的框架里理解。传统知识蒸馏主要有两类。第一类是 SeqKD。teacher 先生成完整答案,然后 student 把这些答案当成 SFT 数据学习。第二类是 S
研究完 Hermes,我最大的感受是:AI Agent 的竞争,正在从模型能力竞争,转向状态工程和执行工程的竞争。模型决定一个 Agent 能不能理解任务。但真正决定它能不能进入生产环境的,是另外一些看起来并不“性感”的问题:状态保存在哪里;哪些信息应该进入 Context;任务失败后从哪里恢复;经验怎样变成 Skill;Skill 怎样验证和更新;工具权限如何隔离;每次操作是否可以审计;系统是否







