logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

你了解transformer吗?nanoGPT 完整解读

缩小每层输出投影的初始值,防止深层网络的初始输出过大。直觉:输入"词→向量"和输出"向量→词概率"是互逆操作,共享参数减少参数量且语义一致。PyTorch 自动完成:从损失出发,沿着计算图反向遍历,用链式法则计算每个参数的梯度。分40次跑,效果等同。:如果差距太大,说明过拟合(记住了训练数据,不会泛化)。📍 源码:model.py →。📍 源码:model.py →。📍 源码:model.p

#transformer#深度学习#人工智能
关于大模型的一些你可能不知道的知识

本文总结了大型语言模型(LLM)的关键技术要点:1)开源与闭源模型的核心差距在于数据质量(私有数据优势)、对齐训练(RLHF等专业调优)、算力规模和工程体系;2)长文本处理存在"中间注意力衰减"问题,实际有效上下文通常仅为标称值的30-70%,可通过位置编码优化和分段处理缓解;3)知识蒸馏技术通过大模型指导小模型,能以1/10成本保留80%以上能力,闭源厂商凭借更强教师模型在该

#学习#人工智能
一文搞定claude code的安装和使用

本文介绍在M1芯片Mac电脑上安装Claude Code的完整流程:1)通过brew安装Node.js环境;2)全局安装Claude Code;3)配置智谱AI代理工具;4)注册平台账号获取API key并完成配置;5)终端输入"claude"命令即可使用。整个过程包含必要的版本验证步骤,并提示其他电脑问题可求助AI解决。文末附有购买API key的优惠链接。

Claude code中文符号踩坑

文章摘要: 在处理中文Markdown文件时,程序自动将中文引号“”转换为英文""的问题。经过排查发现,问题根源在于文件读取方式:使用Node.js的readFileSync方法并指定UTF-8编码时,会自动转换中文符号。解决方案是改用Buffer方式读取原始字节,再通过TextDecoder解码,确保中文标点符号正确保留。最终通过调整文件读取方法成功解决了中文符号被转换的问题

#javascript
智能体学习4——路由的四种实现方式

这篇文章介绍了四种路由实现方式及其代码示例: 基于LLM的路由:利用大语言模型分析用户意图,输出类别标识符。示例使用LangChain框架,通过提示模板让GPT-4分析用户请求并返回分类结果。 基于嵌入的路由:将用户输入和路由目标转换为向量,计算余弦相似度匹配最相似类别。使用Sentence Transformers模型进行语义向量化,支持中文且可本地运行。 基于规则的路由:通过关键词匹配和正则表

#学习
智能体学习17——模型上下文协议(MCP)

文章摘要: 模型上下文协议(MCP)是连接LLM与外部系统的开放标准协议,其核心是构建通用适配器,支持动态扩展工具库。MCP采用客户端-服务器架构,通过四大组件(LLM核心、客户端翻译层、服务器能力暴露层、第三方执行层)实现标准化交互。相比传统函数调用,MCP具有开放协议、动态发现和复用性优势。实际应用中,开发者可通过ADK配置MCP工具集连接文件系统等服务器,或使用FastMCP快速创建自定义服

#学习#人工智能
ClaudeCode帮我写的第一个系统

Claude code实在是太好用了,在公司最近在研究AI生成用例的实践,测试了各种模型、各种场景,终于算是找到了一个生成效果不错的方案,然后我就给cc提需求,它就帮我生成了这样一个系统,实在太牛了。

智能体学习24——高级提示工程技术

**提示工程的核心原则包括清晰具体、简洁明了、使用动作动词、正面指令优先和迭代优化。基础技术涵盖零样本、单样本和少样本提示,适用于不同复杂度任务。结构化提示通过系统提示、角色分配和分隔符提升效果。推理技术如思维链、自洽性和反思提示可增强逻辑推理能力。高级技术包括自动提示优化、负面示例、任务分解和结构化输出等,适用于复杂场景。这些方法可显著提升大语言模型的任务执行效果。

#学习#人工智能
智能体学习20——人类参与环节(Human-in-the-Loop)

一句话:HITL 是让 AI 和人类“各干各擅长的”,AI 负责计算和数据处理,人类负责关键验证、判断和干预。打个比方完全自主的 AI:像让一个实习生独自审批百万贷款——效率高但风险大HITL:像让 AI 做初筛,把可疑案件交给资深信贷员复核——既提效又兜底(变体):像人类经理制定策略规则,AI 按规则高速执行,人类只管“定方向”HITL 的本质:不是把 AI 当人类的替代品,而是当作增强人类能力

#学习#人工智能
    共 40 条
  • 1
  • 2
  • 3
  • 4
  • 请选择