
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

ClinConsensus 是为检验这类能力而构建的大模型评测基准,聚焦复杂临床问答、诊断推理、治疗建议与随访管理等关键能力。它以真实脱敏临床案例为题,将评测重点从“回答是否合理”推进到“回答是否逐条满足临床要求”,旨在检验模型在真实复杂医疗场景中的决策稳定性与输出合规性,探索真实临床使用价值。

本榜单以FeynmanBench为核心评测基准,基于 2000+ 条标准模型相互作用样本,评估10款顶尖大模型对粒子物理图表的拓扑识别与振幅推导能力。FeynmanBench是一个革新性的基准测试,用于评估大型多模态模型(MLLMs)在图表物理推理和形式化符号理解方面的能力。与传统的视觉问答(VQA)任务主要测试局部信息提取不同,FeynmanBench 通过在费曼图场景中进行多步 diagram

本榜单以Geolocation-Bench为核心评测基准,系统性地对12个主流多模态大模型在定位精度、自校准与综合能力上开展对比评测。Geolocation-Bench是一个评估大型视觉语言模型(VLMs)在复杂地理环境下进行街景图像理解、推理与坐标预测能力的基准测试。与传统基于地标匹配的任务不同,Geolocation-Bench通过高分辨率全景街景图像要求模型直接输出经纬度坐标——这一任务需要

AI 狼人杀只是“辩论式评测”的破局起点,这套动态博弈的评测模式,可以无缝迁移到更多真实且复杂的商业与社会场景中,根据规划矩阵,过程透明化、能力多维化、错误可追溯。晓天衡宇AI狼人杀将会在未来尝试更多可能性:多样化游戏配置:支持不同人数、角色组合和规则变体(例如守卫、白痴、狼王),以观察大语言模型在不同信息不对称结构和游戏复杂度下的行为;人机混合对局:允许人类玩家与Agent共同参与,探索人类与大

晓天衡宇评测社区持续关注大模型的发展动态,近期针对国内外主流大语言模型进行了全面评测。榜单从智能体、代码、通用、推理四个维度,并基于20+主流评测基准,对国内外主流大语言模型进行了全面评测,现公布。本文基于Top 10评测结果进行解读,完整26个模型的全量排名和维度得分,欢迎访问晓天衡宇评测社区进行查看。欢迎点击👉🏻查看完整榜单。

最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网,欢迎大家访问查看更详细的评测数据。👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

【摘要】MoonShotAI最新发布的Kimi-K3模型在晓天衡宇大语言模型评测中表现亮眼,综合得分68.31位列总榜第4,成为国产及开源模型之首。评测显示该模型在代码生成(Coding维度第2)和科学推理方面优势突出,长上下文处理能力达88.9分,但复杂任务规划(Agentic维度第4)和场景推理仍是短板。相比前代K2.5/K2.6,K3在参数规模扩大至2800B后实现12.34分的显著跃升,虽

最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网,欢迎大家访问查看更详细的评测数据。👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

晓天衡宇CC-OCR V2该榜单以CC-OCR V2为评测基准,评估模型在多语言识别、文档解析、表格解析、公式识别、信息抽取等场景的综合OCR能力。法律实务:该榜单PLawBench为评测基准,对大模型在实际法律业务场景中的表现作出评测,主要覆盖用户理解、案例分析和文书生成三大方面,旨在评估大型语言模型(LLM)在法律实践中的表现。复杂指令遵循。









