登录社区云,与社区用户共同成长
邀请您加入社区
本文以第三届「京彩台湾」获奖 AI 短片《阿母欸紅龜粿》为落地样本,拆解低资源方言 AI「海峡姬音」的声纹建模三层架构、真实物件反推的多模态生产全链路,重点分享基于 MCP 协议封装方言 AI 能力、接入 AI Agent 生态的实战方案,同时对比垂直方言模型与通用大模型 / TTS 的能力差异,为低资源语言 AI 的工程化落地提供可复用的技术框架。
我们特别设计了初始化数据接口,并附带详尽的README.md文档,方便用户根据需求对数据进行调整和扩展,让你可以轻松上传和修改多模态数据,实现个性化的使用体验。我们推出的这一系统,专为水稻病虫害的多模态可视化管理而设计,核心功能强大,通过查询关系图谱,可以清晰展示各类病虫害的属性及其相互关系。:用户可通过标签查询功能,查看系统中所有节点类型,点击后可获取该节点的详细信息及相关数据展示,提升用户的使
阿里云 EMR Serverless StarRocks 是一款全托管、存算分离的湖仓 OLAP 引擎。它原生集成全文检索 + 标量过滤 + 向量近邻搜索的三路融合查询能力,支持在 Paimon / Iceberg / Lance 等开放湖格式上直接进行多模态混合检索,一条 SQL 即可完成"关键词匹配 + 条件约束 + 语义相似"的联合召回。
周晓晨,目前就职于同程旅行,负责数据平台相关工作,同时也是 Apache SeaTunnel Committer,长期参与 SeaTunnel 社区建设与功能演进。
针对小模型复杂任务处理能力不足的问题,Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,一款基于 Qwen3.5-9B 打造的推理增强语言模型。相比基础模型 Qwen3.5-9B,Qwythos 在多个评测中实现显著提升,其中 MMLU 提升 34 分,gsm8k-strict 数学推理提升 30 分,证明了小参数模型同样能通过高质量推理数据实现能力跃升。如何让更小
7月17日,以“智能伙伴,共创未来”为主题的2026世界人工智能大会(WAIC)在上海开幕。大会期间,中国首个全国产十万卡AI超集群——曙光8000(登峰)真机首次面向全球公开亮相,并入选WAIC 2026“镇馆之宝”。
2026年上半年,360人工智能研究院共有6篇论文入选ICLR、CVPR、ICML、ECCV四大AI顶会。这四个会议被公认为AI领域最难中的顶会,顶尖实验室也经常被拒。更值得关注的是,这些研究全部指向同一个方向:让AI更加精准、更加可控。
构建从触觉感知、数据采集到具身智能的全栈触觉智能生态。
2023 年 GPT-4V 的发布标志着人工智能正式进入多模态时代。与纯文本模型不同,多模态大模型(Multimodal Large Language Model, MLLM)能够同时理解图像、文本(甚至视频、音频)内容,实现真正的"看图说话"。应用场景代表模型核心能力图文搜索文本→图片跨模态检索图像生成文本→图像生成(依赖 CLIP 编码)视觉问答图片内容理解与推理文档分析图表、扫描件、PDF
多模态(Multimodal)并不神秘:本质上就是把图片 / 文本 /(可选:音频)放进同一个请求里,让模型基于这些输入生成结果。内容识别语义理解关系推理信息抽取文本生成这和“先把图片 OCR 成文本,再把文本喂给模型”的方案不一样。后者是典型的串联式流程,前者则是模型原生支持多种输入,通常在理解复杂场景时更自然,也更少丢信息。检索对象不再局限于纯文本生成答案时可以直接参考图片、视频帧、PDF 页
TacReasoner 面向具身触觉推理,提出「冻结外观流 + 可训帧差时序流」的动态感知编码器,并构建首个触觉思维链数据集 TouchCoT-10K,把推理过程显式写进训练目标,在多数子任务上让 7B 反超 14B 的 VTV-LLM。本文逐条精准推导其六个核心公式与两个损失函数,指出帧差与「剪切累积」动机的错位、式(7)期望记号之误、CLS 单 token 瓶颈及 45 样本评测的置信度问题,
近期的基础图像与视频生成模型展现出强大的泛化性与可控性,但其直接向具身场景的应用受到多视角一致性、几何连贯性及机器人本体约束等要求的限制。 的多模态自回归模型,用于统一的具身合成。它将具身生成视为基础图像与视频生成的延伸,并联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。 是首个支持跨多种机器人本体的高质量多视角场景生成的模型,并引入了结构化的可控具身迁移以实现细粒度编辑,同时
本文详细介绍了如何利用谷歌Gemini 1.5 Pro多模态大模型进行视频关键帧分析,通过3步API调用实现1小时视频的高效处理。内容涵盖环境准备、视频分块策略、关键帧提取优化及多模态提示工程,帮助开发者快速掌握这一前沿AI技术,提升视频内容分析效率。
本文详细介绍了如何利用Gemini 1.5 Pro的多模态能力优化PDF与视频分析的准确率。通过三阶段提示工程方法(预处理、执行、后处理),结合结构化输入设计和多模态提示构建,显著提升信息提取效率。实战案例展示了在技术手册处理和视频内容理解中的应用,帮助开发者充分发挥这一AI模型的潜力。
大语言模型作为自然语言处理的核心技术,通过Transformer架构实现文本理解和生成。其原理基于注意力机制,能够捕捉长距离依赖关系,在代码生成、文档编写等场景展现强大能力。多模态技术进一步扩展了AI的应用边界,将视觉与语言理解相结合。在工程实践中,API接口设计、错误处理和性能优化是关键环节。本文针对国内开发环境,详细介绍如何通过免费服务调用接近GPT-4级别的文本生成和图像理解模型,涵盖从环境
大型语言模型作为人工智能领域的核心技术,通过Transformer架构实现高效的序列数据处理。其原理基于自注意力机制,能够捕捉长距离依赖关系,在自然语言理解和生成任务中表现出色。从技术价值看,多模态支持使模型能够同时处理文本、图像、音频等多种数据类型,极大扩展了应用边界。长文本处理能力的提升则解决了传统模型在处理超长文档时的上下文丢失问题。在应用场景方面,这些技术特性使得模型在内容生成、数据分析、
本文深度实测了谷歌Gemini 1.5 Pro的多模态能力,展示其如何通过百万token上下文窗口处理整本PDF与视频内容。文章详细解析了跨模态提示词设计、长文档处理技巧及视频解析黑科技,并提供了学术研究、教育创新等场景的落地指南,助力开发者高效利用这一AI技术突破。
大语言模型作为人工智能领域的核心技术,通过Transformer架构实现了对自然语言的深度理解。其核心原理基于注意力机制,能够捕捉文本中的长距离依赖关系,在代码生成、文档分析等场景展现出强大能力。随着技术发展,多模态理解成为重要方向,模型不仅处理文本,还能解析图像、图表等复杂信息。Grok通过分层注意力机制和动态上下文窗口优化,在推理效率上实现显著提升,内存占用降低约30%,这对实际工程部署具有重
OpenAI推出的多模态大模型,核心优势是跨模态推理能力强,支持文本、图片、视频输入,可完成复杂的图像分析、跨模态问答,缺点是闭源、API调用成本高,集成LangChain需通过官方API封装。阿里开源的多模态大模型,支持文本、图片、音频输入,推理速度快、API调用成本低,完美适配LangChain集成,且支持本地化部署,是本章及后续实操的首选模型,兼顾开源性与实用性。缺点是缺乏复杂推理能力,仅支
多模态模型的原始响应多为非结构化文本,无法直接用于LangChain智能体的决策、存储与交互,需通过响应解析与后处理,将其转换为结构化数据(如字典、列表)。本节将讲解LangChain的输出解析器用法,结合qwen-vl-plus的响应特点,实现多模态响应的标准化处理,适配智能体后续组件(如Memory、VectorStore)的需求。
多模态Prompt工程是提升多模态模型推理精度的核心,与单一文本Prompt不同,多模态Prompt需结合文本指令与多模态数据(图片/音频)的特性,明确任务需求、约束条件与输出格式。本节将结合qwen-vl-plus与LangChain,讲解多模态Prompt工程的核心原则与最佳实践,配套Prompt模板,适配工业巡检、日常交互等多场景。
开源多模态模型(如qwen-vl-plus开源版、BLIP-2)的本地化部署,可解决云端API调用成本高、网络依赖强的问题,适配隐私性要求高的场景。本节将以qwen-vl-plus开源版为例,讲解本地化部署流程,以及LangChain与本地化部署模型的集成调用方法,适配指定依赖,实现离线多模态推理。
langchain-community 0.4.X版本提供了多模态模型的统一API调用接口,可对qwen-vl-plus、GPT-4V等模型的API调用进行封装,简化调用流程,同时适配.env文件API密钥管理,确保调用的规范性与可复用性。本节将重点讲解qwen-vl-plus的API调用封装,兼顾GPT-4V的封装方法,统一适配指定依赖。分析图片中的管道是否存在泄漏,若存在,说明泄漏位置;要求:
2023年AI大模型迎来关键进化,从单模态(仅文字交互)升级为多模态技术,实现文本、图像、音频、视频的全域感知与生成。单模态模型如初代ChatGPT仅能处理文字,与人类多元感知方式脱节;多模态模型则通过统一编码、跨模态融合和生成技术,让AI具备"能看、能听、能说、能画"的全场景能力。主流多模态模型各具特色:GPT-4V擅长高精度推理,文心一言适配本土化需求,通义千问侧重轻量化办公,腾讯混元深耕影音
案例说明:本案例衔接前5章的图片加载方法,通过.env文件管理API密钥,调用qwen-vl-plus实现跨模态推理,输出图片分析结果,直观体现多模态大模型的核心能力,同时适配指定依赖版本,为第7章LangChain集成奠定实操基础。本章案例基于qwen-vl-plus大模型,实现“图片+文本”跨模态交互(工业巡检图像分析),严格遵循指定依赖与.env文件API调用规范,可直接运行,衔接前5章的图
第1章 绪论1.1 研究背景随着数字技术与教育教学的深度融合,智慧课堂已成为教育数字化转型的核心载体,依托物联网、人工智能、大数据等技术实现教学过程的实时感知与智能决策。但当前多数系统仍聚焦出勤率、答题正确率等显性指标,对学生课堂情感状态这一隐性维度的感知能力严重不足。情感直接影响学生的注意力集中程度、知识接受意愿与认知加工效率。课堂场景中,学生的面部表情、语音语调、互动文本等多维度信息共同构成真
1、进入 hyper.ai 首页后,选择「教程」页面,或点击「查看更多教程」,选择「Qwythos-9B-Claude-Mythos-5-1M GGUF 推理部署」,点击「运行此教程」。为了方便开发者快速体验 Qwythos,HyperAI(hyper.ai)已整理相关模型资源,帮助开发者一键完成模型部署,快速上手推理测试与 Agent 开发。Qwythos 的发布为小模型的发展打开了新思路:通过
多模态数据检索是多模态智能体实现“快速获取相关数据、辅助推理决策”的核心能力,其核心是基于特征向量的相似性检索,结合多模态数据类型的差异性,采用差异化检索策略。本节将讲解多模态数据检索的核心原理、常用策略,结合前文集成的向量数据库与qwen-vl-plus大模型,实现多模态检索实操,提升检索精度与效率。其核心优势:无须依赖传统的关键词匹配,可实现跨模态检索(如用文本查询相似图片、用图片查询相关音频
本节将重点讲解LangChain与三种主流向量数据库(Chroma、Pinecone、Milvus)的集成方法,结合多模态特征向量,实现特征存储、批量插入、数据查询等核心操作,适配qwen-vl-plus大模型的多模态推理需求,所有案例均适配指定依赖版本。说明:Chroma为本地向量数据库(无须部署,适合开发测试),Pinecone、Milvus为云端/分布式向量数据库(适合生产环境,需提前注册账
本节将结合多模态场景,讲解数据分割的核心方法、特征提取的实操技巧,结合qwen-vl-plus大模型,实现多模态数据的标准化处理,为集成向量数据库奠定基础。特征提取是将多模态数据(文本、图片、音频)转换为可量化的特征向量,核心是保留数据的核心信息,降低数据维度,适配向量数据库的存储与检索需求。例如,文本分割重叠度不宜过低,图片分割需保留关键区域。(4)特征验证:提取特征后,可通过qwen-vl-p
多模态数据加载是数据处理的第一步,核心是将不同格式、不同来源的多模态数据(本地文件、网络资源)统一转换为LangChain可识别的格式,为后续分割、特征提取及存储奠定基础。本节将基于LangChain 0.3.x版本,详解图片、音频、视频、文本四种核心多模态数据的加载方法,结合qwen-vl-plus大模型的多模态理解能力,实现标准化加载,所有案例均适配指定依赖与.env配置。视频、大型PDF等数
(2)网络问题:OpenAI、Gemini Pro需科学上网,检查网络连接是否正常,是否能访问对应的官网(如https://platform.openai.com/、https://aistudio.google.com/,其中谷歌AI Studio网页可能存在解析失败情况,可尝试更换网络或稍后重试)。补充说明:多模态开发环境问题多与“依赖版本、系统依赖、环境配置”相关,排查时优先检查依赖版本是否
一年前接大模型很简单:拿一个 OpenAI 的 key,写几行调用代码,上线。现在再看这套代码,负责 AI 集成的工程师大概都眼熟:调用逻辑里塞了三个供应商的分支判断,key 直接写在各个微服务的环境变量里,成本没人算清楚,出了敏感数据也不知道拦在哪一层。想从 GPT-4o 切一半流量到 Claude,改动牵扯到七八个文件。问题不在于谁代码写得差,而在于大模型调用早就不只是"调一个 API"了——
多模态大模型(MM-LLM)正处于爆发期,2022 年 Flamingo 首次实现视觉 - 语言交错处理,2023 年 BLIP-2 通过 Q-Former 轻量级接口突破模态壁垒,到 2024 年 NExT-GPT 实现 “任意模态输入 - 任意模态输出” 的通用框架,技术迭代呈现三大趋势:模态融合深化:从早期图像 - 文本双模态,扩展至视频、音频、3D 点云等多模态协同,如 PandaGPT
本文节选自陈敬雷《GPT多模态大模型与AI Agent智能体》一书,重点探讨多模态大模型的核心技术。文章详细解析了多模态基础模型的三大关键技术:对齐(建立跨模态数据关联)、融合(信息整合策略)和表示(数据编码方法),并介绍了CLIP等代表性模型。这些技术使AI系统能够协同处理文本、图像、视频等不同模态数据,实现更强大的理解和生成能力。书中还包含配套视频课程,通过理论解析和实战案例(如模型微调、RL
Nemotron-SFT-SWE-v3 是由 NVIDIA 于 2026 年发布的一个软件工程指令微调数据集,旨在提升大语言模型在 SWE-Bench 风格任务中的代码理解与修复能力。Open-SWE-Traces 是由 NVIDIA 于 2026 年发布的一个面向大语言模型智能体指令微调的数据集,旨在提升模型在软件工程领域的代码修复与多步工具调用能力,广泛应用于代码智能体训练、自动化软件修复系统
多模态
——多模态
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net