
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在讲大语言模型时,大家最熟悉的 usually 是 attention(注意力机制)。它决定当前 token 该看前面哪些 token。。论文的判断很直接:今天的大模型在序列维度上已经学会了“选择性关注”,但在深度维度上,很多模型还在沿用一种相当机械的做法——前面所有层的输出一股脑往后累加。作者认为,这种做法在模型越来越深时,会带来信息稀释和状态膨胀的问题,于是他们提出了 Attention Re
这篇论文的核心创新,是一个叫做 DeepEncoder V2 的新编码器。按照论文的说法,它的目标不是简单提取视觉特征,而是能够根据图像语义动态重排视觉 token。作者认为,传统方法把视觉 token 固定成栅格扫描顺序,其实给模型加入了一种并不合理的先验;对于复杂版式图片,这种顺序和人类真正的观察方式并不一致。
这几年,大模型的发展一直在追求一件事:让模型更强。最直接的办法当然是扩大参数量,因为参数越多,模型能容纳的知识和模式通常也就越多。但问题也很现实,参数变大之后,训练成本会更高,推理也会更贵。尤其在用户真正使用模型时,如果每次回答一个问题都要完整调用整个超大模型,那这种代价很快就会变得难以承受。所以,大模型很快遇到了一个核心矛盾:我们想要更大的模型容量,但又不希望每次计算都把所有参数全部用上。
很多人第一次注意到 temperature 和 top-p,并不是在论文里,而是在产品界面里。比如在 Google AI Studio 的 Run settings 面板中,就可以直接调整 model parameters;如果你改用 Gemini API,也会在里看到topP这样的字段。也就是说,这两个参数不是学术讨论里的边角料,而是今天实际调用大模型时就摆在开发者面前的“生成控制旋钮”。问题也
这三个接口都能让模型“回一句话”,但它们的设计重心并不一样。Chat Completions 更像经典聊天入口;Responses API 更像 OpenAI 新一代统一入口;Claude Messages API 则坚持清晰的 message history 组织方式,并强调 stateless 调用。
很多时候,模型“答得好不好”不只取决于模型本身,也取决于你怎么设置 decoding。就是 vLLM 里控制输出风格、长度、停止条件、概率信息和约束生成的核心入口。SamplingParams 不是“玄学调参”,它是在管模型下一步怎么选 token大模型每次生成文本,本质上是在一堆候选 token 里选下一个 token。负责规定“候选范围多大”“选择要不要随机”“是否惩罚重复”“什么时候停下”“
tools = [{"查询当前登录用户的一笔订单。只读取状态,不修改订单。),"description": "订单编号,例如 A1024"},},}]"content": "帮我查一下订单 A1024 到哪里了。}]
ReAct 将与放进同一个循环。模型不再只靠已有知识直接作答,而是先判断下一步,再调用搜索、数据库、计算器或其他工具,用真实结果继续推进任务。
比如一句话里有很多词,一个词的含义往往不是孤立的。“肿瘤边界不清晰”里面,“边界”需要结合“肿瘤”和“不清晰”理解。再比如做机器翻译时,模型生成中文词语时,需要回头看英文原文。生成“我”时,要参考 “I”;生成“爱”时,要参考 “love”。这两种场景都需要 attention,但信息来源不同。这就引出了 self-attention 和 cross-attention 的区别。
让大模型输出的不再是“看起来像 JSON 的文本”,而是能够被程序稳定消费、校验和落库的结构化数据。在 AI 应用里,最难处理的往往不是模型“会不会回答”,而是它能不能按照程序需要的形状回答。字段缺失、类型错误、额外解释文字、数组层级变化,任何一种情况都可能让后续代码直接报错。







