logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

各有所长,国内外模型安全评估丨多个大模型安全榜单揭晓

覆盖 96 个国内外主流大模型,涉及文本和多模态数据,包括 48 个海外模型(如 Claude-4、GPT-4o 等)、48 个国内模型(如 Qwen3、InternLM等),其中开源模型 75 个,闭源模型 21 个。大模型的在中文环境中的多维度合规性是其在我国广泛应用的关键基础,也是此次评测的重要维度。深层洞察:排名靠前的模型在各评测维度都有比较均衡的安全分数,而排名靠后的模型在社会经济风险维

文章图片
#人工智能
通用安全 ≠ 行业可用!领域安全榜单揭示大模型垂域隐性风险 | 安全评测

从 Shell 基准的风险挖掘,到 MENTOR 框架的自进化防御,研究团队致力于为大模型进入垂直行业应用建立一套可量化的安全标准。然而,教育、金融和管理仅仅是起点。随着 AI 深入医疗、法律等更多核心领域,隐性风险的形态将更加复杂。未来的研究将重点关注如何让模型不仅学会遵守规则,更能理解规则背后的价值观,最终实现从外挂式防御向内化式安全的跨越。司南将持续关注并跟进 Shell 基准的迭代更新,欢

文章图片
#人工智能
会背书 ≠ 懂生命!LifeOmni榜单揭示大模型生命科学实战短板 | 生命科学评测

全员“行动力”匮乏: 观察榜单可以发现,绝大多数模型在 Domain Literacy(专业素养)上的得分都在 0.7-0.8 甚至更高,但在 Agent Ability(智能体能力)的 Action Accuracy(行动准确率)上,却断崖式下跌至 0.3 以下。然而,当我们将这些通用模型从简单的知识考试引入真实的科研探索与临床决策场景时,一个被长期掩盖的真相逐渐浮出水面:高分的理论知识储备,并

文章图片
#人工智能
从短期交易到长期配置:覆盖11个行业的大模型投资顾问评测丨金融评测

相比之下,稳定的行业,如消费防御型、能源和公用事业行业,则表现出相对高的预测得分,这得益于其需求弹性较低、监管透明,并且与宏观经济的强相关性。收集了 110 支各行业代表公司的股票的历史数据,包含经典的开盘价、收盘价、最高价、最低价、交易量,为大模型提供了最基础的预测数据。搜集网络上与每只股票相关的新闻,提供外部的市场信息,反映宏观市场中对股票的看法,助力大模型理解市场现状,做出与当前更相符的判断

文章图片
#人工智能
Gemini-3-Pro-Preview登顶,大模型迈入Agent元年丨大语言模型1月最新榜单揭晓

进入 2026 年,全球大模型技术持续加速演进,新一轮模型发布不断刷新能力边界。行业关注重点从基础能力指标,转向模型在真实复杂场景中的综合表现。各类模型持续强化智能体相关能力,在编程、推理、工具调用与信息检索等关键方向不断提升,全面增强解决实际问题的能力。与此同时,中国大模型在全球舞台上持续受到关注,越来越多模型在海外社区引发热议,展现出中国在大模型日益增强的技术实力与创新活力。司南持续关注大模型

文章图片
#人工智能
GenEditEvalKit:把图像生成评测的 “麻烦事”,一次性解决了

从事图像生成与编辑模型研发的小伙伴们,你们是否也经历过「评测」这些“麻烦事”:新模型刚完成迭代,想跑几个主流 benchmark 验证效果,却要为每一组「模型 × benchmark」单独写一套适配脚本;不同 benchmark 的环境依赖互相打架,配环境配到深夜;想并行跑多个任务提升效率,又要花大量精力改写调度逻辑;好不容易跑完所有任务,生成的图像、评测指标、运行日志散落在各个文件夹,想做一次横

文章图片
#人工智能
GPT-5卫冕榜首!工具调用能力成AI新战场丨大语言模型10月最新榜单揭晓

大模型技术在全球范围内持续演进,各大科技公司纷纷推出新一代模型,重点强化智能体方向的核心能力,包括编程、工具使用和深度信息检索等,无一不在提升实际问题解决能力。伴随着技术升级,越来越多能够解决实际问题的智能体正在涌现——它们能够自主规划任务、协同执行指令,在科研、编程、商业分析等领域展现出切实价值。与此同时,中国大模型在全球持续引人注目,在海外社区引发广泛讨论,展示出中国在大模型研发与应用方面的强

文章图片
#人工智能#语言模型#自然语言处理
断层式领先!Gemini 3.0全方位评测新鲜出炉

近期,谷歌发布了新一代大模型Gemini 3.0,被视为谷歌重回AI第一阵营的关键里程碑。通用基准方面,Gemini-3-Pro-Preview在MMLU-Pro、GPQA-Diamond、MathVision、MMStar等多个基准上的表现显著领先其他模型,展现出了超越现有标杆的通用认知与推理能力。司南OpenCompass对Gemini-3-Pro-Preview的通用文本能力、学科专业文本能

文章图片
#人工智能
DeepSeek-V3.2-Speciale展现世界一流数学能力丨最新公开学术榜单发布

在 MMLU-Pro 基准和 GPQA-Diamond 基准上,各模型得分均与 GPT-5-2025-08-07 相当,以几分之差落后于 Gemini-3-Pro-Preview。随着大语言模型领域进入高速发展阶段,创新活力不断释放,优质模型密集涌现,头部模型的能力迭代节奏也在持续加快。在衡量高难度数学竞赛能力的 AIME2025 基准,以及指令跟随基准 IFEval上,最新一代国产开源模型能力已

文章图片
#人工智能
    共 63 条
  • 1
  • 2
  • 3
  • 7
  • 请选择