
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
多轮对话摘要的嵌入策略面向跨越多个轮次的复杂讨论场景,其核心挑战在于如何在有限的向量维度中压缩丰富的时序演进信息。推荐的策略采用"分层摘要嵌入"模式:第一层为会话级摘要,由 LLM 在会话结束时生成,涵盖主要讨论主题、关键决策、待办事项和未决问题,该摘要作为独立Memory存入专门的房间;第二层为主题级摘要,当检测到会话中涉及多个独立主题时,为每个主题生成子摘要,记录该主题下的核心论点和结论;第三
在介绍具体Skills之前,我们先快速理解一下Claude Code Skills的概念。一句话解释:Skills是一种可复用的能力模块,你可以把它理解成给Claude Code安装的“插件”或“技能包”。每个Skill包含一个特定的提示词模板、工具调用逻辑和输出格式,让Claude Code在遇到特定任务时能够“知道”该怎么专业地处理。通俗理解:就像一个新人入职后,你给他一套标准操作流程(SOP
为什么一个大模型可以在本地跑起来?为什么同一个模型会有 Q4、Q5、Q8 这么多版本?为什么模型能加载,不代表它一定跑得快?为什么有些量化版本体积小了,回答质量也会下降?今天我们来读一篇本地推理相关的论文《Which Quantization Should I Use?A Unified Evaluation of llama.cpp Quantization on Llama-3.1-8B-In
Token是大模型处理文本的基本单位,可以理解为"字"或"词"。换算关系1个英文字符 ≈ 0.3个Token1个中文字符 ≈ 0.6个Token举例原文:"我爱学习AI"Token化:["我", "爱", "学习", "AI"]Token数量:约4个预训练打基础(学知识) →SFT学指令(懂用户) →RM学评判(知好坏) →RL精益求精(更优秀)预训练:决定了模型的"天花板"SFT:让模型"落地"
eepSeek V4 到底是什么规格先把背景说清楚,后面算费用才有意义。DeepSeek V4 分两个版本:V4-Flash 和 V4-Pro。V4-Pro 是这次的主角。1.6T 参数,但采用 MoE(Mixture of Experts)架构,每次推理只激活 49B 参数。这个设计直接决定了它的成本优势——计算量只有 Dense 同参数模型的一小部分,但性能却能打到接近顶级。
多轮对话摘要的嵌入策略面向跨越多个轮次的复杂讨论场景,其核心挑战在于如何在有限的向量维度中压缩丰富的时序演进信息。推荐的策略采用"分层摘要嵌入"模式:第一层为会话级摘要,由 LLM 在会话结束时生成,涵盖主要讨论主题、关键决策、待办事项和未决问题,该摘要作为独立Memory存入专门的房间;第二层为主题级摘要,当检测到会话中涉及多个独立主题时,为每个主题生成子摘要,记录该主题下的核心论点和结论;第三
在介绍具体Skills之前,我们先快速理解一下Claude Code Skills的概念。一句话解释:Skills是一种可复用的能力模块,你可以把它理解成给Claude Code安装的“插件”或“技能包”。每个Skill包含一个特定的提示词模板、工具调用逻辑和输出格式,让Claude Code在遇到特定任务时能够“知道”该怎么专业地处理。通俗理解:就像一个新人入职后,你给他一套标准操作流程(SOP
txtResponse.Text = String.Format("错误 [{0}]", e.Error.Message);这里ReceiverDomain还可使用System.Windows.Messaging.LocalMessageSender.Global,这样就。因为之前发送方已指定了域信息,即“localhost”,所以这里在列表变量:allowedSenderDomains。在上面代
我们的小龙虾可以避免之前杂乱无条理的记忆文本书写与低效的关键词寻找,做到真正的精细化办公,并且达到节省token的目标。那么这样就会出现一个非常明显的问题,虽然说OpenClaw有“上下文压缩”“记忆热插拔”等管理记忆的方法,但是当时间一长我们输入的指令一多,我们的小龙虾的memory文本就会越来越多,越来越杂,就会直接导致小龙虾正在查找相关信息上花费不少没必要的token,而接下来的精细化分库管







