
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文深度拆解RLHF(人类反馈强化学习)三阶段流程:人类偏好标注→奖励模型训练→PPO优化,揭示其如何让模型从“会说话”进化为“说人话”。核心在于用相对排序替代绝对打分,通过奖励模型传递人类价值观,再以KL约束防止“奖励黑客”。文章结合TRL库代码实操,指出RLHF的高成本、不稳定性及避坑指南,并强调其本质是“数据定义价值观”。最终指出,尽管RLHF推动ChatGPT质变,但其局限催生了更高效的D

本文深度拆解通用型AI智能体Manus的“手脑并用”理念,揭示其从“生成答案”到“交付成果”的范式跃迁。核心在于多智能体架构(规划、执行、评审)与工程化编排的融合,实现任务自动拆解、工具调用、状态持久化与错误回溯。通过实战骨架代码演示“规划-执行-评审”闭环,强调最小可行产物清单与人工兜底的重要性。文章指出:通用Agent适合低增多变、容错较高的探索任务,而垂类Agent则深耕高频高风险场景。最终

用编程场景做 Agent 的极致样板。Claude 4 系列模型发布时,配套推出的是一个运行在终端里的编程 Agent——它不是普通的代码补全工具,而是能"理解整个代码库"的结对伙伴:你告诉它需求,它能自己阅读项目结构、定位相关文件、编写代码模块、运行测试、根据报错修复 Bug,一轮轮迭代直到任务完成。Claude Code 之所以重要,不只是因为它写代码写得好,更因为它定义了一种产品形态:开发者

先别急着划走——把这几年的进化放在一起看,你会看到一条惊人的规律。回看这短短几年的六代进化史,最让我感慨的不是技术本身,而是进化的节奏。从 ChatGPT 那个"有脑无手"的静态预言机,到今天能 7×24 小时常驻、自主交付成果的 Manus,中间只隔了不到三年。而如果拉长到七十年尺度看,从专家系统到具身智能,AI 走完"会推理→会做事→能交付→能行动"的全程,拐点恰恰都集中在最近几年——我们正站

先别急着划走——把这几年的进化放在一起看,你会看到一条惊人的规律。回看这短短几年的六代进化史,最让我感慨的不是技术本身,而是进化的节奏。从 ChatGPT 那个"有脑无手"的静态预言机,到今天能 7×24 小时常驻、自主交付成果的 Manus,中间只隔了不到三年。而如果拉长到七十年尺度看,从专家系统到具身智能,AI 走完"会推理→会做事→能交付→能行动"的全程,拐点恰恰都集中在最近几年——我们正站

从"分工流水线"到"统一大模型",理解能力从模块拼接变成了整体涌现。经典流水线用 ASR、NLU、DM、NLG 四个专职模块各管一段,优点是边界清晰、可插拔、可解释,缺点是级联误差放大、知识靠人工焊死、开放表达接不住;大模型把它们压缩成一步端到端生成,换来的是灵活和自然,代价是需要重新解决可控性、成本与安全。报告里对六代 Agent 演进的总结与此完全呼应:对话系统从早期的规则模板、任务机器人,一

本文系统拆解NLP五次范式跃迁:从手写规则到大模型涌现,揭示每代技术的核心假设与边界。通过对比N-gram与词向量实战案例,直观展现“统计”到“表示”的本质飞跃。强调现代NLP应基于任务匹配范式——规则、统计、预训练、大模型各司其职,实现高效选型。最终指出:理解范式演进,核心是掌握“数据-任务-模型”的匹配逻辑,而非追逐单一技术。

本文回溯AI Agent的“史前史”,揭示专家系统、行为主义与BDI模型如何共同奠基现代智能代理。从MYCIN诊断到XCON配置,符号主义以“知识库+推理引擎”架构实现规则驱动决策;行为主义强调感知-行动闭环,推动具身智能发展;BDI模型则赋予代理“信念-愿望-意图”的心智框架。尽管专家系统因知识获取瓶颈与封闭世界假设退潮,其“知识分离”“目标导向”思想却演化为今日大模型Agent的核心范式。文章

本文为《AI硬件体系深度调研》系列收官之作,专为开发者量身定制一条“学得会、用得上”的实操路径。从三阶段学习地图(懂分类→钻原理→看趋势),到训练/推理/终端的选型思维,再到云上实验、混合精度、KVCache与量化等实战技巧,层层递进。附行动清单与避坑指南,强调“搬运数据”本质,倡导以系统视角、动手验证为核心,助开发者高效入局,摆脱参数焦虑,真正掌握AI硬件选型与应用能力。

本文为《AI硬件体系深度调研》系列收官之作,系统梳理全系列核心逻辑:AI硬件本质是“搬运数据的生意”,其发展由“更高并行密度”与“更短传输延迟”双轮驱动。当前产业呈现“单芯片够强、协同带宽不足”的不平衡格局,真实利用率低下。未来确定性机会聚焦三大方向:存算一体(降距离)、硅光互联(扩通道)、异构调度框架(优调度),三者协同破解“搬运成本高”难题。结论强调,竞争已从单点算力转向系统效率,开发者应以“








