logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

WebAssembly:开启高性能Web应用新时代

随着技术的不断发展和生态系统的不断完善,WebAssembly将在未来的Web开发中发挥越来越重要的作用,为用户提供更加丰富和高效的Web体验。例如,Emscripten是一个流行的C/C++到Wasm的编译器,Rust语言也提供了对Wasm的原生支持。与JavaScript相比,Wasm代码在执行时可以接近原生代码的性能,特别适合处理复杂的计算任务,如图像处理、音频处理、游戏开发等。例如,未来可

#wasm#交互#动态规划 +4
大模型联邦学习:隐私保护下的“群体智能“实战

摘要:本文针对传统联邦学习在大模型场景下的通信瓶颈和模型异构问题,提出分层联邦蒸馏(HFD)框架。通过动态参数切分(95%稀疏率)、同态加密量化(CKKS方案)和差分隐私调度(ε=2.3),在6家医院的280万张CT影像联邦训练中,实现通信开销降低95%(7.2GB→360MB/轮),训练时长缩短79%(67→14小时),模型AUC提升12.4%至0.879。特别解决了小医院(2卡V100)性能提

#设计模式#react.js#前端 +4
基于深度学习的语音识别:从音频信号到文本转录

本文介绍了基于深度学习的语音识别系统构建方法。首先概述了语音识别的基本概念,包括音频预处理、声学模型、语言模型和解码器等核心模块。重点阐述了如何使用PyTorch实现声学模型(LSTM)和语言模型,并提供了音频特征提取(Mel频谱图)、模型训练及贪婪解码的完整代码示例。文章还讨论了环境准备、数据预处理等关键环节,展示了从理论到实践的完整流程。最后建议读者尝试Transformer等更先进的模型架构

#深度学习#语音识别#音视频 +3
从“能看”到“看懂”:多模态大模型如何突破视觉理解的瓶颈

多模态大模型(MLLM)正在突破AI视觉理解的瓶颈,实现从"识别"到"理解"的跨越。本文介绍了MLLM的工作原理,包括视觉编码、跨模态对齐和统一解码三个关键步骤,并展示了其在电商图文质检等场景的应用案例。虽然面临图像分辨率、幻觉问题等技术挑战,但MLLM正向着更高分辨率、更强中文语义理解等方向发展。开源项目如InternVL、Qwen-VL等为开发者提供了快

#人工智能#深度学习#机器学习 +4
AI Agent开发实战:基于ReAct范式的智能体构建与优化

本文详细介绍了基于ReAct范式构建多功能AIAgent的全过程。首先分析了ReAct(Reasoning-Acting)范式的工作流程,该范式通过思考-行动-观察循环机制实现智能决策。然后通过完整代码示例展示了如何实现具备联网搜索、代码执行等能力的智能体,包括核心架构设计、工具实现和运行测试。文章还分享了生产级优化策略,如提示词工程优化、记忆管理和工具调用可靠性提升,展示了实际应用中的性能提升数

#react.js#人工智能#前端 +4
RAG系统深度优化:从基础实现到生产级性能提升全攻略

本文系统探讨了检索增强生成(RAG)系统的生产级优化方案,提出5大核心策略:混合检索、查询改写、重排序、上下文压缩和检索结果精修。通过完整Python代码实现,在百万级文档测试中验证了优化效果:答案准确率从62%提升至89%,响应延迟降低54.8%,Token消耗减少73%。文章详细介绍了从基础实现到生产部署的全流程,包括性能评估体系和A/B测试框架,并分享了金融和电商领域的成功案例。这些优化策略

#python#开发语言#人工智能 +4
AI Agent记忆系统深度实现:从短期记忆到长期人格的演进

摘要:本文提出了一套完整的AIAgent记忆管理系统解决方案,解决了现有智能体存在的"金鱼记忆"问题。系统采用MemoryStream架构,集成向量检索、时间衰减、动态权重等技术,支持千万级记忆条目管理,实现94.7%的精准召回率。通过创新性引入反思机制、记忆压缩和分层检索策略,显著提升对话连贯性67%。系统包含可直接集成到ReAct/AutoGPT架构的模块化代码,支持记忆巩

#人工智能#决策树#算法 +4
使用LLaVA构建多模态RAG系统:让大模型看懂你的图库

本文介绍了一种突破性的多模态RAG(检索增强生成)系统,能够同时处理图文信息。该系统通过视觉-文本双空间索引、跨模态对齐重排序和LLaVA微调等技术,在电商、教育、医疗等场景中实现"以图搜图+图文问答"功能,准确率提升40%以上。文章详细阐述了系统架构、核心技术实现(包括视觉编码器优化、混合检索器设计)、LLaVA微调技巧和生产级部署方案,并提供了性能实测数据(优化后响应时间提

#搜索引擎#人工智能#学习 +4
构建高效的RAG系统:从理论到实战全解析

摘要:本文系统介绍了增强型检索增强生成(RAG)技术架构与实现方案。针对传统RAG存在的检索精度低、上下文碎片化等问题,提出三大核心优化:1)基于假设文档嵌入的智能查询改写;2)融合稠密/稀疏检索的混合检索引擎;3)带引用溯源的可控生成机制。通过GPU加速、动态上下文压缩等技术,系统实现89%检索准确率和45ms延迟,吞吐量提升4倍。实验表明该方法能有效解决知识滞后和模型幻觉问题,为生产级RAG部

#transformer#算法#人工智能 +4
基于LLaVA-1.6构建视觉问答RAG系统:从0到1踩坑实录

本文详细记录了作者如何在3周内构建一个高效的多模态RAG系统,用于电商场景的商品图问答。通过对比CLIP+LLaMA2、MiniGPT-4等方案,最终选择LLaVA-1.6+Milvus组合,实现准确率从54%提升至89%。系统采用三阶段流程:1)微调视觉编码器解决商品图识别问题;2)开发多模态检索方案融合图文特征;3)设计抗幻觉解码策略。文章分享了显存优化技巧(AWQ量化、KV cache共享)

#人工智能#前端#开发语言 +4
    共 417 条
  • 1
  • 2
  • 3
  • 42
  • 请选择