logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【AI 后训练教程】一文讲透 OPD:为什么大模型不再只是“背标准答案”?

大模型后训练正在发生一个很重要的变化。过去,我们经常用 SFT、普通知识蒸馏,让模型去模仿标准答案。这个思路很直观:给模型一个好答案,让它学会照着生成。但问题是,模型真正推理的时候,看到的不是标准答案的上下文,而是它自己一步步生成出来的上下文。一旦模型前面某一步走偏,后面就会进入训练时没见过的状态,最后越写越偏。OPD,也就是On-Policy Distillation,同策略蒸馏,解决的正是这个

#python#人工智能#机器学习
大模型后训练新范式 OPD:为什么它能用 1/10 算力挑战 RL?

要理解 OPD 的理论来源,必须先讲 GKD。GKD,全称 Generalized Knowledge Distillation,对应的论文是。这篇论文的重要性在于:它最早把“语言模型蒸馏”明确放到了 imitation learning 的框架里理解。传统知识蒸馏主要有两类。第一类是 SeqKD。teacher 先生成完整答案,然后 student 把这些答案当成 SFT 数据学习。第二类是 S

#人工智能#机器学习#深度学习
拆解 Hermes Agent:真正拉开差距的不是大模型,而是记忆、Skill 与状态工程

研究完 Hermes,我最大的感受是:AI Agent 的竞争,正在从模型能力竞争,转向状态工程和执行工程的竞争。模型决定一个 Agent 能不能理解任务。但真正决定它能不能进入生产环境的,是另外一些看起来并不“性感”的问题:状态保存在哪里;哪些信息应该进入 Context;任务失败后从哪里恢复;经验怎样变成 Skill;Skill 怎样验证和更新;工具权限如何隔离;每次操作是否可以审计;系统是否

#人工智能#python#系统架构
大模型越强,Agent 越需要“笼子”:从 OpenClaw 看懂智能体的确定性控制系统

自治级别:高允许:自动检索读取文件生成总结禁止:修改数据向外发送调用生产接口它有 Gateway。它支持多渠道。它有会话系统。它可以调用工具。它有记忆和插件。这些当然重要。但更值得学习的是这些组件背后的共同目标:把一个具有概率性的大模型,装进一个可控、可追踪、可恢复的确定性系统。从这个角度看,生产级 Agent 至少要完成六件事:第一,用控制平面统一身份、会话、路由和权限。第二,把工具列表升级为动

#oracle#数据库
别再把 AI Agent 理解成“大模型加工具”:一文讲透 Token、Skill、RAG、MCP、SDD 与 Harness

本文从工程视角重新拆解 AI Agent,说明为什么 Agent 并不等于“大模型加工具”。文章系统分析 Token、Prompt、Tool、Skill、RAG、MCP、SDD 与 Harness 的职责边界,并通过供应商风险分析案例,讲解生产级 Agent 如何完成任务规划、工具调用、状态管理、结果验证、权限控制和人工审批。

#人工智能#大数据#python +2
别再把多模态大模型理解成“能看图的 LLM”了:一篇真正讲透 Text、Image、Audio、Video 如何进入大模型

本文深入探讨了多模态大模型的核心原理与技术难点,指出其本质在于将不同模态的数据(如图片、音频、视频、文字)转换为机器可处理的统一表示形式(Representation)。文章系统性地拆解了五个关键环节:表示学习(Representation)、语义对齐(Alignment)、模态融合(Fusion)、信息压缩(Compression)和时间建模(Temporal Modeling),强调这些概念比

#人工智能#python#transformer +1
一篇真正讲透多模态大模型:图片、声音和文字,到底是怎么被塞进同一个 Transformer 里思考的?

多模态大模型的核心在于将不同模态(文字、图像、视频、音频)的数据转化为统一的向量表示,并通过Transformer架构实现跨模态推理。文章通过解析视觉Transformer(ViT)的工作原理,说明如何将图像分割为视觉Token(Patch),再通过线性映射转换为向量序列,与文本Token在相同的高维空间对齐。关键环节包括表示学习(将原始数据编码为向量)、模态对齐(建立跨模态语义关联)、注意力融合

#transformer#深度学习#人工智能 +2
模型训练原理(一):别急着学 Transformer:所谓“训练大模型”,其实就是把一堆数字一点点改对

本文深入浅出地阐述了大模型训练的核心机制,指出初学者常因过早关注Transformer架构而忽略更基础的训练原理。文章通过单参数模型示例,揭示了机器学习本质是参数优化过程:模型通过计算预测结果与真实值的差异(Loss),利用梯度(Gradient)确定参数调整方向,配合学习率(Learning Rate)完成参数更新(Parameter Update)。这一过程在数十亿参数的大模型中同样适用,只是

#transformer#深度学习#人工智能
模型训练原理(二)|大模型为什么只靠“预测下一个 Token”,就能学会语言、知识和代码?

这篇文章深入解析了大语言模型训练的核心机制,重点阐述了NextTokenPrediction如何解决无标注数据的训练问题。文章首先指出传统监督学习需要人工标注(x,y)对的局限性,进而揭示语言模型利用文本自身结构自动生成训练信号的原理:将前文作为输入,原文的下一个token作为标签目标。 作者详细阐释了自回归建模的本质,说明模型通过链式法则将整个序列的概率分解为连续的nexttoken预测任务。文

#数据库#oracle#服务器 +2
大模型训练原理(八)|为什么把一个 Token 变成几千个数字,它反而开始有“意义”了?——Embedding 真正讲透

本文深入解析了NLP模型中Token Embedding的核心机制与重要性。文章首先指出Token ID仅是离散编号而非语义表示,直接输入存在数值关系误导的问题。然后分析了one-hot编码的局限性:无法表达词间关系且维度爆炸。真正的解决方案是Embedding——将Token映射为连续高维向量,这些向量作为可训练参数在预测任务中自动学习语义关联。 关键点包括: Token ID是地址索引,Emb

#oracle#数据库#服务器 +2
    共 61 条
  • 1
  • 2
  • 3
  • 7
  • 请选择