logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Kimi K3 训练篇:一文详解 2.8 万亿参数的K3模型如何训练

摘要 K3模型训练的核心在于构建高保真的真实世界模拟环境。其训练流程包含预训练数据准备、原生多模态联合训练、长上下文课程学习以及后训练三阶段(监督微调、强化学习和多教师蒸馏)。关键创新包括:1)数据改写保真校验确保知识准确性;2)视觉与语言从预训练开始联合优化;3)渐进式扩展的上下文窗口训练;4)可配置的白盒RL环境支持多种工具框架;5)5121万个沙箱构建的真实任务环境。训练特别强调"环境真实性

文章图片
#架构#人工智能#语言模型
DeepSeek新框架DSpark原论文拆解

这次我们要拆解的是 deepseek 联合北京大学发表的官方投机解码框架,但是对于论文原文大家阅读都比较困难,所以我下面就以「原文 English → 中文翻译 → 拆解解释」的格式来为大家深度解读一下整篇论文到底讲了什么,话不多说,我们下面就以原文开始

文章图片
#DeepSeek#人工智能
Claude 能做的,远比你想象的多

这篇文章介绍了Claude AI的四个隐藏功能:Projects(项目记忆)、Artifacts(交互应用)、Adaptive Thinking(深度推理)和Memory(个人信息记忆)。每个功能都配有具体开启方法和实用prompt模板,能显著提升工作效率。文章特别强调这些被多数用户忽略的功能可以改变Claude的基础使用体验,使其从普通对话工具转变为个性化工作助手,并提供心理咨询师、严厉导师等角

文章图片
#前端#人工智能
Claude 新发布的 Opus 5,系统提示语删了 80%,半价还能逼近 Fable 5

本文探讨了Claude第5代模型的核心改进——通过"上下文工程"大幅精简系统提示(砍掉80%),使模型不再依赖人工预设的复杂规则。文章对比了新旧范式的六组差异:从硬性规则转向信任模型判断力、从示例教学转向接口设计、从信息堆砌转向渐进披露等。作者建议在构建AI代理时,将系统提示聚焦产品定位,CLAUDE.md记录关键注意事项,Skills封装独特经验,References提供高保真素材。最后介绍了自

文章图片
#android#数据库#服务器 +1
Kimi 昨天发布了 K3 的技术文章,我从中读到的信息

Kimi K3开源报告解读:开源模型如何追赶闭源前沿? 月之暗面发布的Kimi K3技术报告揭示了开源模型追赶闭源前沿的关键路径:必须突破预训练规模瓶颈。报告指出,当前开源社区在推理技术上已接近前沿,但1T级参数规模成为天花板。K3通过三管齐下的设计实现突破: 三维信息流架构:序列维(KDA+MLA混合注意力)、深度维(AttnRes跨层注意力)、宽度维(896专家MoE)协同优化; 工程级创新:

文章图片
#人工智能#语言模型
为什么 Kimi K3 敢把 KV Cache 扔掉?一篇讲透 GPT-2 到 K3 的架构进化

本文探讨了从GPT-2到Kimi K3的模型演进历程,揭示了规模扩张背后更本质的架构革新。核心观点认为,大模型发展实质是围绕"记忆管理"的三元问题展开:KV Cache通过缓存历史Key/Value解决重复计算问题;Linear Attention将O(N)缓存压缩为O(1)状态;DeltaNet实现有限缓存下的精准记忆编辑,通过"读-算差-写"机制避免信息污染。最终,Kimi K3融合这些技术形

文章图片
#架构#人工智能#缓存
Kimi K3 架构篇:一文详解 2.8 万亿参数的巨型怪兽

Kimi K3 架构通过优化序列、深度、宽度三条信息轴,实现 2.5 倍效率提升。序列轴采用 KDA(Kimi Delta Attention),通过固定大小的递归状态和逐通道遗忘门解决长上下文问题;深度轴引入 Block AttnRes,分层块注意力缓解信息稀释;宽度轴结合 MoE 稀疏激活,平衡算力与容量。关键设计包括:KDA 的数值优化适配 Tensor Core、3:1 混合注意力兼顾效率

文章图片
#架构
你的 AI Agent 正在被攻陷,而大多数团队还蒙在鼓里

上个月底,Uber 把开源了,论文还中了 MLSys 2026。我 clone 下来跑了一遍,又去翻 RSAC 2026 上一票号称 agent 安全的项目。一圈看完之后的感觉是:大家都说自己在做「agent 安全」,但根本不在同一层干活。有的在做资产清点,有的在做沙箱隔离,有的在做凭据治理,有的在做运行时行为分析,还有的干脆就是在卖 prompt injection 防火墙。

文章图片
#人工智能#代理模式#语言模型
卧槽!!!一觉起来国产模型干翻Fable5了

Kimi K3深度解析:2.8万亿参数开源巨兽登顶竞技场 摘要:2026年7月,月之暗面发布新一代开源旗舰模型Kimi K3,其2.8万亿参数规模创全球开源模型新高。该模型凭借三大创新架构——混合线性注意力KDA、注意力残差AttnRes和稳定隐空间MoE,在长序列处理和深层网络优化上实现突破,整体效率较前代提升2.5倍。在权威竞技场评测中,K3前端代码能力登顶全球第一,文本总榜跻身前十,并在物理

文章图片
#人工智能#语言模型
手把手掌握图工程

这篇文章不是概念科普,是一份能直接落地的手册。我会先把"图"到底是什么讲清楚(包括一个最容易踩坑的"假边"概念),再给一个我认为今年最值得掌握的模式,然后三个能直接抄的构建,最后收一份操作清单。所有 prompt 我都保留了英文原样——像 Claude Code 这类工具对英文指令里的"编排意图"识别更稳,复制即可用;如果你用 LangGraph / CrewAI / 自研 DAG 调度,思想完全

文章图片
#原型模式#人工智能#语言模型
    共 54 条
  • 1
  • 2
  • 3
  • 6
  • 请选择