logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型量化技术简介

大模型量化 是一种模型压缩技术,其核心思想是使用更低精度的数据类型(如8位整数INT8)来表示和计算原本更高精度的数据类型(如32位浮点数FP32或16位浮点数BF16/FP16)的模型参数和激活值。目前发现不使用4字节FP32精度转而使用2字节FP16半精度可以获得几乎相同的推理结果,这样就可以部署在存储空间不大,计算速度不快的设备上了(如手机,嵌入式设备,边缘计算);如果每个参数占的字节数少点

#人工智能
使用docker本地部署dify

如果你发现某个容器反复重启,就是用docker logs 容器id 看一下具体原因,然后将日志丢给豆包之类的大模型,然后一步步解决问题;前置条件 docker, docker-compose。最后登录在浏览器中输入 http://服务器ip。首次登录是要设置账号密码的。docker 换国内源。

#docker#容器#运维
使用docker安装向量数据库milvus

图形化管理工具:Milvus WebUI (Milvus v2.5.0之后有)milvus-minio : 对象存储服务容器,负责所有原始数据的持久化存储。milvus-standalone:Milvus 核心服务容器。milvus-etcd: 元数据管理服务容器。使用docker compose安装。启动完成之后可以使用。

#人工智能
AI 大模型应用中的图像,视频,音频的处理

批量处理工具替代循环, 避免用 for 循环单文件处理,频繁启动 FFmpeg 进程耗时,Linux/macOS用xargs ,Python 脚本结合 subprocess 模块多进程处理。预处理:提前解码与缓存(若处理视频抽帧后的图片,可先将视频一次性解码为原始帧序列(如 BMP),再批量处理(避免重复解码视频))图像:格式/尺寸统一(常用PNG/JPEG/WebP格式)音频: 格式/音频编码/

#人工智能#音视频
大模型的记忆与管理及长期记忆实现方式

实现框架:目前有多种创新框架,如 TIM 框架,它使 LLMs 能够维护一个随对话流不断演进的记忆库,用于存储历史思考痕迹,包含响应生成前的检索相关思考和响应生成后的事后反思并更新记忆库两个关键阶段;基本概念:长期记忆是指大模型能够存储历史交互、用户偏好等信息,类似于人类的长期记忆,使模型能够在后续的交互中利用这些信息,实现自我进化和更个性化的服务。重要性:长上下文处理能力使大模型能够处理更复杂的

#RAG#数据库#人工智能
大模型应用中统计token数量

流式输出需在stream_options中设置include_usage: true以获取完整统计。但并不是所有模型 都在这个库里面。2.使用tiktoken库。所以指定一下编码比较好。

#人工智能
大模型应用中的意图识别和槽位抽取

会给模型带来巨大的处理负担,使模型难以准确地捕捉和理解其中的关键内容,容易出现混淆和错误的关联,进而影响其对意图和槽位的准确识别和抽取。通过提示词设计,无需添加复杂的额外算法或模型架构,就可使 AI 智能体快速具备意图识别和槽位抽取能力。目的是需要智能体能够理解准确各种各样、形式各异但意思相近的问题,(比如方言类、反问语气、情绪化语气等),这就要求 LLM 节点得有很强的泛化和识别能力。但比较贵,

#人工智能
大模型推理优化方案

① 量化②剪枝(Pruning)③知识蒸馏(Knowledge Distillation)①GPU 加速(NVIDIA/AMD)②CPU 加速(Intel/AMD/x86/ARM)① 通用推理引擎②生成式模型专用引擎① 批处理与动态调度②内存优化③轻量级部署工具推理优化是提升大模型(尤其是小参数模型如 Qwen2-0.5B-Instruct)部署效率的核心环节,除了之前提到的llama.cpp优化

#人工智能
大模型架构理解与学习

②有些任务只需要 “生成”(比如聊天、写代码),不需要依赖明确的 “输入理解”(开放式生成)—— 于是单独拿出 Decoder,做成了。(比如 GPT 系列(GPT-1~4)、LLaMA 系列(LLaMA 1/2/3)、Qwen(通义千问)、Mistral);①有些任务只需要 “理解”(比如判断评论是好评还是差评),不需要 “生成”—— 于是单独拿出 Encoder,做成了。③有些任务需要 “先理

#人工智能#语言模型
多模态大模型应用技术栈

图文检索的核心是 “跨模态语义对齐”—— 让模型学会 “文本描述的含义” 与 “图像视觉特征” 的对应关系。核心逻辑是将文本和图像映射到同一高维向量空间,通过计算向量相似度(余弦相似度 / 内积)实现 “以文搜图”“以图搜文”“图文配对”。模型选择: Stable Video Diffusion(SVD)/Open-Sora/ 魔搭社区视频模型。模型选择:CLIP / BLIP-2 / Effic

#人工智能#深度学习#计算机视觉
    共 73 条
  • 1
  • 2
  • 3
  • 8
  • 请选择