
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
点击下面卡片,关注我呀,每天给你送来AI技术干货!论文题目:Zero-shot Visual Question Answering using Knowledge Graph本文作者:陈卓...
来自:专知近年来,随着大型模型的显著发展,大型视觉-语言模型(LVLMs)在各种多模态理解和推理任务中展示了卓越的能力。相比于传统的大型语言模型(LLMs),由于更接近多资源的现实世界应用和多模态处理的复杂性,LVLMs 展示了巨大的潜力和挑战。然而,LVLMs 的脆弱性相对较少被探索,在日常使用中可能存在潜在的安全风险。在本文中,我们对现有的各种 LVLM 攻击形式进行了全面的回顾。具体来说,我
来自:炼钢AI最近开始看看视觉语言模型(VLM)相关的东西了,之前没特别仔细看过代码。翻了几篇比较知名的开源VLM技术报告,感觉DeepSeek-VL算是写的比较好的,因此本文就以DeepSeek-VL为例,结合代码写一写VLM的细节。VLM和LLM比较共性的东西比如Self Attention之类的本文就不过多介绍了,重点讲一讲VLM独有的内容。DeepSeek-VL github链接:htt.
最后,本文讨论了智能系统带来的潜在应用、社会风险和治理问题,并提出了未来的研究方向,旨在发展一个由人类意图和自主智能体行为共同塑造的开放、安全和智能的生态系统。华文越,Rutgers博士毕业,张永锋老师的学生,UCSB博后,现在为微软研究院高级研究员,主要研究方向为llm reasoning和llm-based agent,在NLP和ML的顶会ACL EMNLP ICLR Neurips TACL
如此一来,Agent在游戏过程中便可生成足够长且复杂的推理链条,并且随着对手能力的提升,其所面临的挑战也会越来越大,并被激发出更强的视觉理解与推理能力。任意形式的图片都可作为输入:和以往有限制条件的游戏化训练框架不同的是,Vision-Zero可在任意形式的图片上启动游戏,这使得模型可以在很多不同的领域里获得相应的能力提升,并有很好的泛化性能。本文作者包括来自杜克大学的汪勤思,林阅千,李海教授,陈
我们选择了四个有代表性的现有生成式奖励模型(GenRMs)进行评估,包括两个基础 LLM:Llama-3.3-70B 和 Qwen3-8B,以及两个微调过的生成式奖励模型(GenRMs):Skywork-Critic-Llama-3.1-70B 和 Selene-1Mini-Llama-3.1-8B。为验证传统上下文扩展方法的有效性,我们选择了原生支持32K上下文的Con-J-Qwen2-7B模型
在医疗、法律、金融等高风险的现实应用场景中,任何细微的逻辑偏差都可能导致严重后果,因此对推理的严谨性提出了极高要求。尽管目前已有不少纯文本逻辑推理评测基准,但现实中的许多任务往往融合了视觉与文本信息,亟需模型具备跨模态的严密推理能力。例如,在交通控制或自动驾驶系统中,模型不仅需要理解交通规则文本,还需结合实时驾驶场景的图像信息,通过可靠推理做出安全且合规的决策。项目地址:https://llm-s
24 年我来湾区后,在他们三番办公室见了他们的管理层,随便聊了聊工作生活的话题。今年夏天在美国时,又和他们的管理层聊了不少次,在三番办公室里给他们的创始人、CEO、CPO 等做了几个小时的演讲,觉得相互之间的技术都高度互补,Elastic 的高层对我个人非常友好和信任,于是就开始了这个收购案。对于 Jina AI 而言,这其中包含很多的复杂的因素,包括美国和中国之间的地缘政治(当然还有德国),多个
的概念 ,因为如果 Agent 和 Tool 互相“勾结”(Reward Hacking),可能会导致 Agent 为了得分而伪造工具调用结果,这将是灾难性的。不要试图用 Prompt 解决所有问题,试着为你冻结的大模型训练一个专属的“小助手”(Adapter/Tool),这可能是 ROI 最高的技术投资。现在的系统要么是“改人不改工具”(A1/A2),要么是“改工具不改人”(T1/T2)。),更
结果显示了完全的“推理崩塌”:尽管 OCR 表面精度很高,但在涉及逻辑推理的QA任务中,DeepSeek-OCR 的正确率只有27.7%,而同等参数大小的语言模型正确率都在90%以上(见图3);结论:DeepSeek-OCR 的高分表现,很大程度上是建立在“语言先验”之上的幻觉,而非纯粹的视觉识别能力,并且这种现象在其他的端到端模型中也普遍存在。这为这一范式的未来发展敲响了警钟:要实现真正有效的长







