logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AutoIAD:多 Agent 驱动的工业异常检测自动化框架

本文提出AutoIAD框架,采用Manager驱动的多Agent协作机制实现工业异常检测自动化。通过中央调度模块协调四个专业子Agent,并引入包含数据增强策略、模型模板和训练脚本的领域知识库,显著提升了任务执行效果。在MVTecAD数据集上的实验表明,AutoIAD以88.3%的成功率和63.69%的平均AUROC优于通用框架,消融实验验证了Manager和知识库的关键作用。研究揭示了领域知识对

文章图片
#视觉检测#计算机视觉#人工智能 +2
IEEE IoT-J | CoDrone:Depth Anything V2+VLM云边端协同,无人机自主导航飞行距离+40%

中山大学团队提出CoDrone框架,通过端-边-云协同实现无人机自主导航优化。系统采用三层架构:端侧基于灰度图轻量导航(减少66%输入通道),边缘通过DepthAnythingV2进行深度估计并压缩为一维占用栅格,云端Qwen-VL-Max通过函数调用机制直接输出控制指令。核心创新包括:1)仅需1万FLOPs的DRL神经调度器动态协调三层资源;2)DEGAGE算法将深度图转换为可行驶区域分类;3)

文章图片
#物联网#无人机
Pipecat:构建实时语音 AI Agent 的开源编排框架,500ms 级端到端延迟

Pipecat是一个开源Python框架,专注于解决语音AI落地的工程编排问题。它将ASR、LLM、TTS等AI服务通过管线(Pipeline)方式连接,实现端到端延迟500-800ms的实时对话系统。框架支持18+语音识别服务、18+大语言模型和24+语音合成服务,并提供多模态交互能力。Pipecat还包含客户端SDK、开发工具和结构化对话模块,适用于语音助手、客服系统等多种场景。虽然依赖外部A

文章图片
#人工智能#开源#语音识别 +3
浙大团队提出PowerGPT:面向电力巡检的多模态基础模型,构建20万张图像数据集与专用评估基准

浙江大学团队提出PowerGPT,一个面向电力巡检的多模态基础模型,通过统一架构解决传统任务碎片化问题。研究构建了包含20万图像、80万指令对的PSID数据集和覆盖70个场景的PowerBENCH评估基准。PowerGPT融合自适应视觉提示和知识检索增强技术,在5项任务中全面领先通用模型,其中GroundedCaption得分达9.6(LLaVA仅5.0)。消融实验显示,仅领域数据微调就带来平均1

文章图片
#算法#人工智能#开源 +3
ICLR 2026 | Judo: 7B小模型工业缺陷问答超越GPT-4o,用对比学习+强化学习注入领域知识

摘要:Judo是一种针对工业异常检测的多模态推理模型,通过三阶段渐进训练解决通用大模型在工业领域的知识不足问题。首先通过并置分割学习建立视觉对比能力(准确率提升至73.01%),然后注入领域知识(准确率79.82%),最后采用多奖励GRPO统一视觉和推理(最终准确率81.20%)。实验表明,无领域知识的CoT推理会使准确率下降9.5%,验证了领域知识的重要性。在MMAD基准测试中,Judo超越GP

文章图片
#学习#人工智能#github +2
把 Whisper、Moonshine、SenseVoice 统统装进手机:sherpa-onnx 离线语音部署框架,GitHub 10.9K Star

语音AI推理部署框架sherpa-onnx发布1.12.29版本,支持12项语音功能和多平台部署。该框架由next-genKaldi团队开发,可将Whisper、Moonshine等主流语音模型统一转换为ONNX格式,实现跨平台离线运行。支持12种编程语言和多种硬件架构,包括移动端、嵌入式设备和浏览器环境,并提供NPU加速支持。最新版本新增Supertonic2TTS模型,持续完善多语言绑定和模型

文章图片
#github#人工智能
Pipecat:构建实时语音 AI Agent 的开源编排框架,500ms 级端到端延迟

Pipecat是一个开源Python框架,专注于解决语音AI落地的工程编排问题。它将ASR、LLM、TTS等AI服务通过管线(Pipeline)方式连接,实现端到端延迟500-800ms的实时对话系统。框架支持18+语音识别服务、18+大语言模型和24+语音合成服务,并提供多模态交互能力。Pipecat还包含客户端SDK、开发工具和结构化对话模块,适用于语音助手、客服系统等多种场景。虽然依赖外部A

文章图片
#人工智能#开源#语音识别 +3
15K Star中文首发!$5部署一个会自我进化的私人Agent——NousResearch开源Hermes Agent

Hermes Agent是由NousResearch开发的个人AI助手,GitHub 16,819 Stars,MIT开源。核心亮点是自我进化闭环:完成任务后自动创建可复用技能,技能在使用过程中持续优化,配合MEMORY.md+USER.md双文件持久化记忆和跨会话历史搜索,形成"经验→能力"的完整进化回路。内置40+工具(覆盖搜索、代码、视觉、定时任务等)和105个技能(MLOps占27个),支

文章图片
#开源#人工智能
国产小龙虾方案实战:nanobot + 通义千问,钉钉上随时派活

本文介绍了一个基于国产AI技术的轻量级智能助手方案,整合了nanobot框架、通义千问大模型和钉钉机器人。该方案通过4000行代码的nanobot框架实现消息接收、工具调用和技能管理,利用通义千问Qwen3.5Plus进行智能推理,并支持联网搜索功能。系统配置了9个自定义技能,涵盖文档处理、数据分析、代码审查等日常工作场景,用户可直接在钉钉上对话并派发任务。部署过程简单,只需安装nanobot、配

文章图片
#人工智能#语言模型#github +1
YOLO26:实现目标检测进入端到端时代

YOLO26实现端到端目标检测,彻底移除NMS后处理 摘要:Ultralytics发布的YOLO26标志着目标检测技术的重大突破,首次完全移除了NMS(非极大值抑制)后处理步骤。通过三项关键创新——One-to-One检测头、MuSGD优化器和STAL+ProgLoss训练策略,该模型实现了原生端到端推理,CPU推理速度提升43%。YOLO26不仅简化了部署流程,还支持检测、分割、分类等多任务统一

文章图片
#目标检测#人工智能#计算机视觉
    共 49 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择