
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Lumine是由字节跳动Seed团队发布的通用AI智能体,它能够在3D开放世界游戏中实现实时感知、推理和行动。基于Qwen2-VL-7B-Base模型,Lumine通过类人交互范式,将感知、思考和行动整合在一起,展现出强大的任务执行能力、战斗能力、解谜能力、NPC交互能力以及GUI操作能力,并且具备跨游戏泛化能力。

DeepSeek-Math-V2 是一个专注于数学推理的开源大语言模型,由 DeepSeek 团队开发。它基于 DeepSeek-V3.2-Exp-Base 构建,采用验证器 - 生成器协同进化的训练方式,通过自我验证机制显著提升了数学定理证明和推理的严谨性。该模型在国际数学奥林匹克竞赛(IMO)、中国数学奥林匹克竞赛(CMO)和普特南数学竞赛(Putnam)等权威基准测试中表现出色,接近满分水平

GLM-4.6V是智谱AI与清华大学联合推出的多模态大模型系列,旨在实现高保真视觉理解和长上下文推理。该系列包含基础版GLM-4.6V(106B参数,12B激活)和轻量版GLM-4.6V-Flash(9B参数),支持长达128K tokens的上下文,并首次将原生多模态函数调用能力融入视觉模型,实现了从视觉感知到可执行行动的闭环。

Paper2Slides 是一个开源的 AI 工具,能够将学术论文、报告和文档转换为专业幻灯片或海报。它采用 RAG(检索增强生成)机制,直接从文档本身提取内容,确保生成的幻灯片内容准确且可追溯,避免信息漂移。该工具支持 PDF、Word、Excel、PowerPoint、Markdown 等多种文件格式,能精准捕获关键见解、图表和数据点。用户可以选择内置的专业主题,也可以用自然语言描述来生成自定

Fun-Audio-Chat 是一款专注于自然、低延迟语音交互的大型音频语言模型。它通过引入双分辨率语音表征(5Hz 的高效共享主干 + 25Hz 的精细头部)大幅降低计算成本,同时保持高质量语音输出,并采用 Core-Cocktail 训练策略保留强大的文本语言模型能力。该模型在口语问答、音频理解、语音功能调用、语音指令跟随和语音共情等多个基准测试中均取得了顶尖成绩。

本文深入讲解 MCP(Model Context Protocol)协议的原理与实战,通过"文件读取 Bot"和"百度地图查询助手"两个完整案例,你将掌握 MCP 的两大传输模式(Stdio 子进程通信 与 HTTP/SSE 远程调用)、学会如何通过 `McpToolProvider` 将远程 MCP 服务器暴露的工具动态注入到 LangChain4j 的 AI Service 中、对比 MCP

VoiceSculptor是由西北工业大学联合多家机构开源的音色设计模型,基于LLaSA-3B和CosyVoice2开发,专注于通过自然语言指令生成多样化音色的语音合成。它支持对语速、音量、基频等属性的细粒度控制,引入了类似CoT的推理机制,通过属性Token和自然语言指令联合训练,显著提升了模型对指令的理解和执行能力。

Nemotron Speech ASR是一个开源的低延迟实时语音识别模型,专为英语流式转录设计。它采用缓存感知的FastConformer编码器和RNNT解码器,能够处理16kHz单声道音频,输入块至少为80毫秒。该模型支持多种推理时间块配置,可在不重新训练的情况下灵活调整延迟与准确性之间的平衡,适用于语音助手、实时翻译、会议记录等多种场景。

FireRedASR2S是小红书Super Intelligence-AudioLab开源的工业级一体化语音识别系统,集成ASR(自动语音识别)、VAD(语音活动检测)、LID(语种识别)和Punc(标点预测)四大核心模块,支持普通话、20余种方言、英语、中英混合、代码语音及歌词识别,在24个测试集上平均字错率低至9.67%,达到当前开源领域SOTA水平。该系统采用模块化架构设计,各组件既可协同工

大语言模型不仅能处理文本,还能"看懂"图片、"听懂"音频、"画出"图像。多模态能力让 AI 应用从单一的文本交互升级为全方位的感官体验。本文将带你掌握 LangChain4j 的多模态开发技术,包括 GPT-4V/GPT-5 的视觉理解、DALL·E 3 的图像生成、Whisper 的语音转文字。我们将通过真实代码示例,展示如何让 Java 应用识别图片内容、根据描述生成图像、转录音频文件,并分享








