
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
适用场景:语音识别、手写/OCR、手语视频转文本等输入/输出长度不对齐且只需句级标注的任务。CTC通过对其路径求和让模型在无需帧级标签的前提下训练。输入特征序列:x1:T,长度T(例如T帧视频或声谱帧)。词表:V(字符/拼音/词片),再额外加blank。模型在每个时间步t产生一个分布p(k|xt)表示在实践步t模型对当前步输出为k的后验概率(即已知这一帧的内容估计对应标签为k的概率)这里的xt常指
从数据中学习模型的过程,叫做学习,也叫做训练;训练过程中使用的数据,叫训练数据;训练数据中的每一个样本,叫做训练样本;训练样本组成的集合,叫做训练集合;学得的模型对应了关于数据的某种潜在规律,叫做假设g;潜在规律自身,叫做真相或真实f。监督学习是利用带有标签的数据,通过学习输入->输出(标签)的映射关系,来建模数据规律的方法。(分类任务:预测结果是离散的;回归任务:预测结果是连续的)非监督学习是在
最开始,大模型更多像一个“会聊天、会写字、会回答问题”的系统。用户问它一个问题,它返回一段文字;用户让它解释、总结、翻译,它也主要是在对话框里完成回应。但随着使用场景越来越复杂,人们很快发现,很多需求并不只是“得到一个回答”就够了,而是希望模型把事情继续往下做。比如,不只是告诉你某份文件可能有问题,而是直接去读取文件内容;不只是帮你规划待办,而是进一步创建提醒、查询日历、调用外部服务。于是,大模型
这几年,大模型的发展一直在追求一件事:让模型更强。最直接的办法当然是扩大参数量,因为参数越多,模型能容纳的知识和模式通常也就越多。但问题也很现实,参数变大之后,训练成本会更高,推理也会更贵。尤其在用户真正使用模型时,如果每次回答一个问题都要完整调用整个超大模型,那这种代价很快就会变得难以承受。所以,大模型很快遇到了一个核心矛盾:我们想要更大的模型容量,但又不希望每次计算都把所有参数全部用上。
很多人第一次注意到 temperature 和 top-p,并不是在论文里,而是在产品界面里。比如在 Google AI Studio 的 Run settings 面板中,就可以直接调整 model parameters;如果你改用 Gemini API,也会在里看到topP这样的字段。也就是说,这两个参数不是学术讨论里的边角料,而是今天实际调用大模型时就摆在开发者面前的“生成控制旋钮”。问题也
很多时候,模型“答得好不好”不只取决于模型本身,也取决于你怎么设置 decoding。就是 vLLM 里控制输出风格、长度、停止条件、概率信息和约束生成的核心入口。SamplingParams 不是“玄学调参”,它是在管模型下一步怎么选 token大模型每次生成文本,本质上是在一堆候选 token 里选下一个 token。负责规定“候选范围多大”“选择要不要随机”“是否惩罚重复”“什么时候停下”“
tools = [{"查询当前登录用户的一笔订单。只读取状态,不修改订单。),"description": "订单编号,例如 A1024"},},}]"content": "帮我查一下订单 A1024 到哪里了。}]
ReAct 将与放进同一个循环。模型不再只靠已有知识直接作答,而是先判断下一步,再调用搜索、数据库、计算器或其他工具,用真实结果继续推进任务。
在讲大语言模型时,大家最熟悉的 usually 是 attention(注意力机制)。它决定当前 token 该看前面哪些 token。。论文的判断很直接:今天的大模型在序列维度上已经学会了“选择性关注”,但在深度维度上,很多模型还在沿用一种相当机械的做法——前面所有层的输出一股脑往后累加。作者认为,这种做法在模型越来越深时,会带来信息稀释和状态膨胀的问题,于是他们提出了 Attention Re
这篇论文的核心创新,是一个叫做 DeepEncoder V2 的新编码器。按照论文的说法,它的目标不是简单提取视觉特征,而是能够根据图像语义动态重排视觉 token。作者认为,传统方法把视觉 token 固定成栅格扫描顺序,其实给模型加入了一种并不合理的先验;对于复杂版式图片,这种顺序和人类真正的观察方式并不一致。







