logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多模态大模型推理优化:视觉Token压缩、KV Cache共享与批处理工程实战

这种"视觉 Token 膨胀"问题已成为多模态 AI 应用落地的最大经济障碍。:| 场景 | 无共享 | 有共享 | 加速比 ||------|-------|-------|--------|| 单图多轮对话 | 3.2s | 1.1s | 2.9x || 多图单轮对话 | 5.5s | 3.8s | 1.4x || 多图多轮对话 | 12.3s | 4.2s | 2.9x || 相同图片不同问

#python#人工智能#深度学习 +1
端侧大模型部署实战:从模型压缩到NPU适配的完整链路

单纯堆叠参数的"大模型路线"正在放缓,轻量化、低成本、可落地的端侧 AI 技术成为产业应用的主流方向。但要在一个功耗受限的设备上运行一个数十亿参数的大模型,工程挑战巨大——从模型压缩到运行时优化,从硬件适配到功耗控制,每一个环节都需要精心设计。2026年的端侧 AI 已经从"能跑"进入"好用"阶段,3B 级别的量化模型在旗舰设备上已能达到 40+ tokens/s 的生成速度。## 第一步:模型选

#人工智能
大模型推理优化三级体系:量化、投机采样与MoE稀疏激活的工程实践

| 模型组合 | 候选数 | 接受率 | 加速比 | 质量变化 ||---------|--------|-------|--------|---------|| Llama-70B + Llama-7B | 4 | 72% | 2.1x | 无损 || Llama-70B + Llama-7B | 8 | 65% | 2.4x | 无损 || Qwen-72B + Qwen-1.8B | 5 |

#python#人工智能#开发语言
大模型幻觉检测与事实校验系统2026:RAG+Self-Consistency+外部知识的三层防线

# 结语幻觉问题的终极解决方案不在于"让模型不犯错"(这是不可能的),而在于"系统性地检测和纠正错误"。在AI应用从"玩具"走向"工具"的过程中,事实校验不是可选项——它是你获得用户信任的唯一方式。”——这可能是AI领域流传最广的段子。尽管2026年的模型在事实准确性上已有巨大进步,但幻觉问题并未消失——它只是从"明目张胆的编造"转变为"以假乱真的细微偏差"。通过多次采样并观察结果的一致性,我们可

#人工智能#视觉检测#jira
大模型微调新范式2026年中:SPIN、DPO、KTO与Constitutional AI对齐训练的工程对比

有高质量的偏好对比数据(好回答 vs 差回答)- 需要快速迭代(DPO训练速度是PPO的3-5倍)- GPU资源有限(只需要2个模型而非4个)- 对齐目标相对简单(如让回答更有帮助性、更友好)## 三、KTO:无需偏好对的直接优化KTO(Kahneman-Tversky Optimization)的最大创新是不需要成对的偏好数据——你只需要知道每个回答"好"还是"不好",而不需要知道哪个更好。推荐

#人工智能#python#机器学习 +1
大模型推理服务架构演进2026:Serverless、K8s与边缘部署的工程选型

大模型推理服务的部署架构,是 2026 年 AI 工程领域最受关注的议题之一。随着模型规模持续增长、推理成本居高不下、应用场景日益多元,企业必须在云端、容器、Serverless、边缘之间做出务实的选型。本文从工程视角梳理当前主流的大模型推理服务架构,分析它们的适用场景、核心 trade-off 与落地经验。

#架构#serverless#kubernetes +3
大模型Function Calling可靠性工程:从协议到生产的稳定性设计

json{ "name": "query_weather", "parameters": { "type": "object", "properties": { "city": {"type": "string", "description": "城市名,如北京"}, "date": {"type": "string", "format": "date", "description": "日期,格

#人工智能#c++#可用性测试
大模型量化部署:从 INT8 到 4-bit 的工程演进

大模型量化是降低推理成本、提升部署效率的核心技术。通过将模型权重从高精度浮点数转换为低精度整数,可以显著减少显存占用和计算量,使大模型能够在边缘设备、消费级 GPU 甚至移动端运行。本文将系统介绍大模型量化的技术原理、主流方法和工程实践。

#人工智能#机器学习#算法 +1
大模型训练数据合成与质量评估:从数据稀缺到数据富足

高质量训练数据是大模型能力提升的核心驱动力。然而,随着模型规模不断扩大,人类标注数据的成本和时效性逐渐成为瓶颈。数据合成(Data Synthesis)作为一种通过模型或规则生成训练数据的方法,正在从辅助手段变成主流方案。本文将深入探讨大模型训练数据合成的技术路线、质量控制方法和实践经验。

#人工智能#深度学习#数据库
大模型 API 网关架构设计:多模型路由、限流降级与成本治理

传统软件测试的确定性假设在 AI Agent 面前彻底失效——同一个输入可能产生不同输出,环境状态随时变化,工具调用可能失败也可能成功。Agent 测试不是验证"给定输入是否产生预期输出",而是验证"Agent 的行为是否在可接受的边界内"。本文系统梳理 Agent 测试工程的方法论与实践。

#人工智能#回归#数据挖掘
    共 876 条
  • 1
  • 2
  • 3
  • 88
  • 请选择