
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
仅凭最终答案准确率评估大模型科学推理能力,是否会因模型使用无效捷径而高估其真实水平?论文定义并量化了“解题黑客”现象,开发了基于专家知识的反作弊策略,证明当前评估严重高估了前沿模型的推理能力。

如何在保持极低活跃参数量的前提下,显著提升开源编码大模型的代理式编程能力?论文提出Qwen3-Coder-Next——一个80B总参、仅激活3B参数的MoE架构编码专用模型,通过规模化可执行任务合成、多阶段代理训练与专家蒸馏,实现小足迹下的强代理性能。

如何构建一个能原生支持文本、图像、音频及音视频理解与生成,并具备实时交互和自主代理能力的统一全模态大模型?论文提出了 Qwen3.5-Omni,通过混合专家架构和自适应对齐技术,实现了 256k 上下文、超低延迟流式交互及音视频代码生成等 SOTA 能力。

在长思维链监督下,推理模型的监督微调(SFT)是否真的无法跨领域泛化,还是其泛化能力受特定条件制约?论文推翻了"SFT 仅记忆而 RL 才泛化”的固有认知,证明推理 SFT 的跨领域泛化是优化动态、数据质量与模型能力共同作用的条件性结果。

现有的测试时扩展方法往往孤立地处理每个问题,未能系统性地复用先前的过程性知识(如如何重构问题、选择策略或回溯),导致推理模型在复杂任务中效率低下且准确率受限,如何解决这一知识复用难题?论文提出了“推理记忆”框架,通过构建包含 3200 万条目的子问题 - 子程序知识库,并在推理过程中动态检索和注入过程性先验,显著提升了模型在数学、科学和编程任务上的表现。

如何有效解决推理型大语言模型在面对无法回答或存在误导的问题时,因幻觉而错误作答而非正确选择拒答的难题?论文提出了查询错位框架及 TRACEINVERSION 方法,通过反转推理轨迹重构模型意图并对比原始问题,显著提升了模型在多种场景下的拒答准确率。

前沿大语言模型在解决复杂规划问题时,是依赖简单的启发式策略,还是能像经典算法一样进行真正的全局最优推理?揭示了推理增强型大模型在复杂组合爆炸场景下,不仅能求解,还能严格保持理论最优解,性能超越了因搜索空间爆炸而失效的传统规划器。

在大语言模型强化学习后训练中,必须丢弃单次使用的轨迹数据才能保持高性能,还是可以通过经验回放复用数据来显著降低计算成本?论文挑战了严格在线策略训练的共识,证明设计良好的经验回放缓冲区能在不降低甚至提升模型性能的前提下,节省高达 40% 的推理计算资源。

如何构建一个能原生支持音频输入,同时在文本、图像、视频及长上下文理解上保持高精度与低延迟的高效全模态大模型?论文提出了 Nemotron 3 Nano Omni,这是首个原生支持音频的 Nemotron 多模态模型,通过架构创新和分阶段训练策略,在文档理解、长音视频 comprehension 及智能体任务上取得领先结果,并大幅降低推理延迟。

如何构建一个能够统一处理文本、图像、视频和音频,并在跨模态检索及垂直领域任务中实现状态最先进性能的原生多模态嵌入模型?论文提出了基于Gemini架构的Gemini Embedding 2,通过多阶段对比学习和合成数据增强,实现了全模态统一表示及SOTA性能。








