logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AI Coding:不同工具形态的能力与边界

<think>好的,用户需要一篇关于AI编程工具形态分析的摘要,要求不超过150字。内容涵盖能力维度、边界来源、六种工具形态对比,以及主流工具特点。 先抓住核心结构:能力由四维度决定(上下文、操作、验证、自主程度),边界来自三层面(交互、环境、责任分配),六种形态各有适用场景,四款主流工具各占生态位。 字数限制很紧,需要极度精简。提炼关键句:能力与边界成对出现,形态匹配比强度更重要,工

文章图片
AI Coding:不同工具形态的能力与边界

<think>好的,用户需要一篇关于AI编程工具形态分析的摘要,要求不超过150字。内容涵盖能力维度、边界来源、六种工具形态对比,以及主流工具特点。 先抓住核心结构:能力由四维度决定(上下文、操作、验证、自主程度),边界来自三层面(交互、环境、责任分配),六种形态各有适用场景,四款主流工具各占生态位。 字数限制很紧,需要极度精简。提炼关键句:能力与边界成对出现,形态匹配比强度更重要,工

文章图片
MAX API 2.0:开启智能运维时代 · 从统一模型网关走向 AGI 原生治理与运营

<think>我们只需要根据内容生成≤150字的文章摘要。内容主要介绍MAX API 2.0,是一个智能运维时代的模型网关,面向AGI应用治理,强调开放协作。需要提取核心要点。摘要应简洁。</think>MAX API 2.0开启智能运维时代,定位为应用与上游模型间的统一网关及治理控制平面,面向AGI应用提供多模型接入、权限与成本治理、可恢复计费、证据与安全控制,并通过开放协作社区推进AGI工程化

文章图片
#运维
ICLR2023 - 基于视觉语言预训练模型的医疗图像小样本学习及零样本推理性能研究

大规模预训练视觉语言模型(VLM)在自然图像上表现出了显著的领域迁移能力。然而,这种能力是否也能应用于医学图像领域仍然是未知的。本文深入研究了预训练的VLM在医学领域的知识可转移性,表明设计良好的医学提示是从预训练的VLM中获取知识的关键。研究表明,通过使用域间共享的表达性属性提示,VLM可以跨域传递知识,提高其泛化能力。这种机制使VLM能够在较少或没有图像样本的情况下识别新对象。

文章图片
#学习#人工智能#计算机视觉
ICLR2022 - 语言驱动的语义分割

我们提出了 LSeg,一种用于语言驱动语义图像分割的新型模型。LSeg使用文本编码器计算描述性输入标签(例如“草”或“建筑物”)的嵌入,以及使用基于Transformer的图像编码器来计算输入图像的每像素密集嵌入。图像编码器通过对比度目标训练以将像素嵌入与相应语义类别的文本嵌入对齐。文本嵌入提供了一种灵活的标签表示形式,在这种表示形式中,语义上相似的标签映射到嵌入空间中的相似区域(例如“猫”和“有

文章图片
#计算机视觉#深度学习#人工智能
MAX API 2.0 开启智能运维时代:SmartOps智能运维中心上线,全面升级可观测性、计费对账与账户安全

以全新的智能运维中心为核心,将活动告警、渠道性能、模型性能、系统信息和计费结算对账整合至统一的管理员工作台。新版本提供主机资源异常通知、1–168 小时性能分析、模型级加权指标与趋势、数据质量标记,以及待结算记录的审阅、批量关闭和用户阻断策略,为后续安全、可控的运维自动化建立基础。

文章图片
#运维#安全#数据库
国产万亿参数 AI 开源!Ling-1T 凭什么颠覆大模型效率?

蚂蚁集团开源万亿参数大模型Ling-1T,在12项复杂推理测试中取得领先成绩。该模型采用混合专家架构(MoE)、FP8混合精度训练等创新技术,实现高效推理和精准输出。Ling-1T在语言学习、智能交互、内容创作等领域展现强大应用潜力,支持128K长文本处理和多语言任务。模型已开源,用户可通过Hugging Face和ModelScope获取,还提供在线体验平台。文章详细介绍了技术原理、应用场景和使

文章图片
#人工智能
百度发布文心一言5.0预览版大模型:多模态能力全面超越GPT-5?

百度声称,该模型的多模态融合使其能够比依赖特定模态编码器的模型更有效地生成和解读视觉内容,并具备更强的上下文感知能力。虽然百度没有公开完整的基准测试细节或原始分数,但其性能定位表明,百度有意将 ERNIE 5.0 定位为旗舰模型,而不是小众的多模态系统,该旗舰模型可以与通用推理领域最大的封闭模型相媲美。百度声称,该模型在基于文档和图表的基准测试中击败了 GPT-5-High 和 Gemini 2.

文章图片
声形意合,令出智随!Qwen3-Omni-Flash!阿里团队发布多模态大模型!

阿里发布Qwen3-Omni-Flash全模态大模型,支持视频、语音、文本多模态实时交互。该模型在数学推理、音频理解、语音生成等方面表现突出,在多项基准测试中超越GPT-4o和Gemini。支持119种文本语言和19种语音识别语言,具备拟人化语音合成能力。适用于虚拟助手、视频分析等场景,通过阿里云平台提供实时视频分析、语音对话等功能,向AGI通用智能迈进一步。

文章图片
#人工智能#机器学习#计算机视觉
打破 Agent 推理“存储墙”:清北与DeepSeek 联手发布大模型新推理架构

这篇由清华大学、北京大学与 DeepSeek(深度求索)联合发表的论文,并没有直接谈模型参数,而是切中了当前大模型落地的“七寸”:智能体(Agent)推理的存储带宽瓶颈。简单来说,当 LLM 变成 Agent,推理的逻辑变了,硬件的压力点也变了,这就需要有新的推理架构来应对新的挑战。DualPath 就是为了解决这些挑战而生的。

文章图片
#架构
    共 246 条
  • 1
  • 2
  • 3
  • 25
  • 请选择