logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Token分析】从单轮到多轮:Ark / OpenAI 风格大模型 API 的上下文管理与 Token 成本分析

本文分析了单轮与多轮大模型API调用的区别及其Token成本。单轮请求是无状态的独立调用,模型仅处理当前输入。多轮对话通过显式拼接历史消息实现上下文连续性,其中assistant角色内容需手动传入。这种方式虽然简单,但会导致Token成本随轮数线性增长,尤其对长对话影响显著。文章强调模型本身无记忆能力,上下文连续性完全依赖输入Token构造,为后续优化技术(如缓存、压缩等)提供了理论基础。

#人工智能
【Claude使用技巧】Claude 的第一次启动:从命令行到 /init

本文介绍了使用Claude CLI工具时的关键第一步——执行/init命令。文章指出,许多用户会直接让Claude优化代码,却忽略了初始化项目上下文的重要性。/init命令会引导Claude识别项目类型(如Git仓库、语言框架等),建立项目级上下文,从而避免后续出现理解偏差。执行该命令后,Claude会生成包含项目概览、架构说明等信息的文档,为后续协作提供基础。作者强调,先让Claude&quot

文章图片
#人工智能
【LLM实战】用 API 调用大模型:OpenAI 与 Ark 的工程实践指南

本文介绍了从零开始构建生产级LLM API调用架构的实战指南。首先分析了API调用的必要性,大模型正成为基础设施服务(Model-as-a-Service),支持智能客服、报告生成等场景。然后详细讲解了OpenAI API的调用方法,包括获取API Key、Python代码示例和LLM API调用方式,并深入解析了Client对象和Prompt的工程意义。最后介绍了企业级模型服务Ark的调用方式,

文章图片
#语言模型
【LLM基础知识】深入理解 Tokenization:大语言模型的第一课

本文介绍了大语言模型中的Tokenization(分词)技术,它是将自然语言文本转换为机器可处理数字序列的关键预处理步骤。文章首先阐述了分词的基本概念和作用,指出词元(Token)是模型处理的最小单元,并通过嵌入(Embedding)转换为数值向量。随后详细解析了分词的完整流程:文本标准化、分词、数值编码和嵌入映射,其中重点说明了文本标准化的具体方法(大小写转换、Unicode归一化、标点移除等)

文章图片
#语言模型#人工智能#自然语言处理
【深度学习基础】互相关与卷积的本质区别及在深度学习中的应用

摘要:本文分析了卷积神经网络中互相关与卷积的数学区别。

文章图片
#深度学习#人工智能
【深度学习原理】深入理解梯度爆炸(Gradient Explosion)及解决方案

本文深入解析了深度学习中的梯度爆炸问题。梯度爆炸指反向传播时梯度值指数级增长,导致数值溢出和训练不稳定。其核心原因是深层网络梯度链式乘积中权重矩阵范数大于1时的累乘效应,尤其在ReLU激活函数下梯度路径筛选会放大该问题。数学推导和实验表明,即使初始梯度正常,连续矩阵相乘也会快速引发数值爆炸。梯度爆炸会导致浮点数溢出、参数更新失控等问题,严重影响模型训练。理解这一现象的成因有助于设计更稳定的网络结构

文章图片
#深度学习#人工智能
【深度学习基础】为什么卷积层可以视为线性映射?—从结构展开到统计等价

本文系统分析了卷积神经网络第一层可被抽象为线性映射$\mathbf{Z} = \mathbf{WX}+\mathbf{b}$的理论依据。研究表明,卷积的线性性来源于空间局部加权和跨通道组合两个层次的结构叠加。从统计视角看,这种抽象在分析均值、方差等统计量传播时是合理的,因为Normalize等操作仅依赖于线性变换本身,而与具体实现结构无关。因此,在初始化、梯度稳定性等理论分析中,将卷积层视为带约束

文章图片
#深度学习#人工智能
【LLM基础知识】深入理解 Tokenization:大语言模型的第一课

本文介绍了大语言模型中的Tokenization(分词)技术,它是将自然语言文本转换为机器可处理数字序列的关键预处理步骤。文章首先阐述了分词的基本概念和作用,指出词元(Token)是模型处理的最小单元,并通过嵌入(Embedding)转换为数值向量。随后详细解析了分词的完整流程:文本标准化、分词、数值编码和嵌入映射,其中重点说明了文本标准化的具体方法(大小写转换、Unicode归一化、标点移除等)

文章图片
#语言模型#人工智能#自然语言处理
【PyTorch】detach:从计算图中切断梯度的原理与实践

本文介绍了PyTorch中detach()方法的核心原理与应用场景。detach()通过切断计算图中的梯度路径,使部分计算在反向传播时被视为常数。文章通过数学公式和代码示例展示了该方法如何控制梯度传播范围,并对比了其与no_grad()、eval()的区别。典型应用包括推理阶段数据转换、冻结网络模块等场景。最后强调detach()返回的Tensor与原数据共享存储,需谨慎进行原地操作。该机制为模型

文章图片
#pytorch#人工智能#python
[Cursor代码跳转失效]为什么 Cursor 在 SSH 项目中无法跳转?一次远程开发索引机制的工程级拆解

在使用 Cursor 通过 SSH 进行远程开发时,许多开发者都会遇到一个令人困惑的问题:本地项目中正常工作的“跳转到定义(Go to Definition)”,在远程项目中却频繁失效。本文从工程原理出发,系统解析代码跳转功能背后的 Language Server Protocol(LSP)工作机制,说明跳转失败并非快捷键或编辑器本身的问题,而是与语言服务、索引构建、运行环境以及路径映射密切相关。

文章图片
#ssh#运维
    共 39 条
  • 1
  • 2
  • 3
  • 4
  • 请选择