
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
DeepSeek发布V3.2-Exp实验模型,引入原创DeepSeek稀疏注意力(DSA)技术,通过"闪电索引器"智能筛选关键Token,将计算复杂度从O(L²)降至O(L·k)。该技术使长文本处理速度提升2-3倍,内存占用降低30-40%,API调用成本下降超50%,同时保持与V3.1-Terminus相当的性能。作为迈向新一代架构的关键步骤,DSA采用三阶段训练策略平衡效率

本文深入解析大模型能力的核心基础——预训练过程及其关键"预训练目标"。预训练作为大模型的"通识教育"阶段,通过海量无标注数据训练,使模型掌握语言规律和世界知识。文章系统阐述了预训练的重要性:知识压缩存储、通用语言表示习得、先验知识提供及能力涌现的基础。重点剖析了各类预训练目标(自回归、自编码、混合目标等)的技术特点及其对模型能力的塑造作用,并梳理了代表性模型

本文系统解析了大模型推理生成中的解码策略技术。解码策略作为连接概率分布与文本序列的"决策引擎",其核心作用包括:1)控制生成质量,平衡连贯性与多样性;2)优化计算效率,处理指数级搜索空间;3)适配不同应用场景。当前主流策略包括贪心搜索、束搜索、Top-k/p采样等,各有其适用场景和优化技巧。技术演进呈现三大趋势:推测解码加速生成、并行解码范式革新、垂直场景精细优化。国内外主流模

AI推理时代的数据存储挑战与上下文学习技术演进 随着AI应用从训练转向推理,多模态生成内容(如图片、视频)导致数据需求呈指数级增长,存储需求可能提升数十至数百倍。大模型规模扩展受限于HBM和GPU资源,使上下文学习(ICL)成为下游任务适配的关键技术。ICL作为推理阶段的元学习手段,通过动态构建输入上下文来引导模型行为,其技术体系涵盖输入优化、推理增强和评估校准三层架构。行业趋势显示,从模型微调转

大模型正从聊天问答走向自主决策的智能体(Agent),但开发者面临知识碎片化、缺乏系统路径的困境。本系列从工程视角出发,围绕Agent原理、工具调用、设计模式、MCP、Agent Harness及生产级治理,为前端与后端开发者提供一条从基础到落地的完整学习路线,助你真正掌握可稳定运行的企业级智能体系统。

AI Agent的深入解析:超越大模型与工具调用的系统思维 传统认知将AI Agent简化为"大模型+工具调用",这仅能解释基础功能却无法说明现实差异。本文揭示了Agent作为目标驱动系统的本质,提出五层架构模型: 目标与指令层:明确任务契约与执行规则 模型与决策层:动态认知资源与灵活规划机制 上下文与记忆层:信息选择与管理系统 工具执行层:结构化能力调用与受控环境 反馈评估层

开发 Agent 不必先深入模型训练与算法,但必须理解大模型作为“概率型 API”的运行边界。本文围绕 Token、上下文窗口、消息角色、生成参数、Structured Output、JSON Schema、Function Calling、Embedding、Rerank、流式输出和多模态输入,结合合同审查 Agent 说明这些能力如何协同,并给出兼顾模型能力、成本与延迟的选型思路,帮助开发者建

文章摘要:本文探讨了Agent开发中的Context Engineering问题,指出仅依赖复杂的Prompt无法解决多轮推理任务中的信息过载问题。文章对比了Prompt Engineering和Context Engineering的差异,强调后者关注动态信息组装,包括系统指令、业务数据、工具和历史等分层管理。通过合同审查案例,说明了如何按任务阶段组织上下文,提出信息裁剪、压缩和预算控制等策略,

Function Calling 让大模型从“生成文本”走向“调用真实程序能力”。模型根据工具名称、描述和 JSON Schema 选择工具、生成参数,应用程序再完成校验、鉴权、执行和结果回传。文章结合天气查询、销售数据与计算 Agent,说明并行调用、失败处理、前后端调用及权限控制,并梳理 Function Calling 与 ReAct、Tool、Skill、MCP 的关系:ReAct 负责执

Structured Output 是 Agentic AI 连接大模型与业务系统的重要基础能力。它通过 JSON Schema、DTO 和多层校验,将模型生成的概率性结果转化为程序可解析、可验证的数据。文章结合 OpenAI 原生 Structured Outputs 与 DeepSeek JSON Output,介绍结构约束、类型映射、异常重试、业务校验和权限检查,并强调:JSON 合法、Sc








