logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型项目的分词器

深度学习与 Transformer 架构在本质上是一组高度复杂的连续浮点数矩阵乘法运算。然而,人类语言是由离散符号构成的非结构化字符串序列。:GPU 的张量核心(Tensor Core)只能对浮点标量、向量或高阶张量进行矩阵运算,无法直接对或'你好,世界'进行梯度反向传播。若将人类词典中的每一个词都映射为一个独立的独热向量,词表一旦达到数十万规模,每一个词向量的维度就是数十万维,且各向量之间彼此正

#人工智能
WebSocket 和 SSE 通信的区别及局限性

在传统的 Web 开发中,HTTP 是典型的“请求-响应(Request-Response)”半双工通信协议。为了打破“客户端不发请求,服务端就无法主动通知”的限制,工业界先后经历了短轮询(Polling)、长轮询(Long-Polling/Comet)、WebSocket 到 SSE 的演进历程。1.1 WebSocket 协议原语:脱离 HTTP 的全双工通道WebSocket(RFC 645

#websocket#网络协议#网络 +1
Skill 是什么?

在人工智能技术体系的发展脉络中,Skill 是连接大模型非确定性思考与真实系统确定性控制之间的桥梁。│ Skill 技术演进趋势展望 ││ 阶段一:手工定义 (Manual) ││ 工程师手写 Prompt、定义 JSON Schema 并实现底层 API 调用代码。││ ││ 阶段二:检索与路由自动化 (RAG-Driven) ││ 技能库扩展至成百上千,系统通过语义匹配与动态载入避免上下文膨胀

#数据库#人工智能
LLM 是如何学会调用外部工具的?

大模型学会调用外部工具,是人工智能从单纯的“语言交流”迈向“通用行动体(Action Agent)”的关键一步。数学层面:它依旧是基于概率分布的自回归 Token 预测;协议层面:它是大模型与外部系统通过标准 JSON Schema 与特殊控制标记约定的状态协商;训练层面:它依靠覆盖单工具、多工具、反问澄清与负样本的高质量 SFT 轨迹,以及掩码损失计算与受限解码算法的保驾护航;进化层面:它正加速

#数据库#人工智能
什么是 Function Calling ?

在初学者的认知中,最常见的误解是:“大模型直接调用了我写的 Python 函数或远程 API。事实并非如此。在整个 Function Calling 链路中,大语言模型从始至终只做了一件事:文本生成(Next-Token Prediction)。它不具备任何操作系统的网络权限,没有执行代码的环境,更不能直接向外部数据库发送网络报文。│ Function Calling 的职责切分 ││ 大语言模型

#数据库#人工智能
AI Agent 的记忆机制

目前以 GPT-4o、Claude 3.5、DeepSeek 为代表的大语言模型(LLM),其底层本质是一个无状态的概率预测引擎。每一次 API 调用,模型都在一个隔离的上下文环境中进行推理,它既不知道“用户上周提过什么需求”,也无法记住“在过去十次工具调用中踩过的坑”。如果仅仅依赖基础的大模型 API,所谓的 Agent 只不过是一个被动响应的单次计算函数。无记忆 Agent:Input (Pr

#人工智能
hot100 盛最多水的容器(11)

设左指针指向的基准高度为 x=height[left],右指针指向的基准高度为 y=height[right]。新的高度最大不会超过 x(因为即便 height[right−1] 非常大,容器高度依然受限于短板 x)。为了寻找可能更大的面积,必须提升容器的高度。:左右两条垂线中的较低者 min(height[left],height[right])。:所分配的辅助空间不随输入数据规模 n 的增大而

#数据结构#leetcode#java +1
大模型:从原理、演化史到开发者落地指南

如果你近两年关注技术圈,一定会发现一个现象:传统的 NLP(自然语言处理)任务——比如文本分类、情感分析、实体识别——正在被一种统一的范式取代。过去,我们需要针对每一个特定任务单独训练一个专用模型;而现在,只需向一个大语言模型(Large Language Model, LLM)发送一段 Prompt(提示词),它就能顺畅地完成翻译、写代码、总结文档乃至逻辑推理。这场变革的核心,就是大模型(LLM

#开发语言
大模型 API 调用全景指南

在人工智能飞速发展的今天,大语言模型(LLM)已经深刻改变了软件开发的技术范式。过去需要搭建庞大团队、标注海量数据才能实现的自然语言处理任务,如今只需要几行 Python 代码、通过 HTTP 调用大模型 API 即可高效完成。对于绝大多数应用开发者而言,然而,从“写一个 Demo 调通 API”到“构建出高可用、低延迟、成本可控的生产级系统”,中间存在着巨大的工程鸿沟。

#语言模型#python
大模型生成策略与幻觉抑制

大语言模型(LLM)本质上是一个基于海量文本训练的高维概率预测引擎。输入序列 [Token 1, Token 2, ... Token t] ──> 大模型 ──> 计算概率分布 P(Token t+1) ──> 采样输出模型的核心驱动力是“概率上的语言流畅性”,而非“逻辑上的事实客观性”。当模型面对训练数据中的空白区、歧义指令或长链条推理时,为了维持文本连通,它会倾向于顺应概率分布去构建看起来合

#人工智能
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择