
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数
本次工作面向 Qwen3.6 系列大语言模型开展统一精度评测,评测对象包括 Qwen3.6-27B-W8A8 量化模型、Qwen3.6-27B-BF16 全精度模型以及 Qwen3.6-35B-A3B 混合专家模型,评测数据集包括 CEval 金融法律六科、BoolQ 和 GSM8K。针对大语言模型在 thinking 模式下可能因最大输出长度不足而产生的空预测、推理截断和最终答案缺失问题,本次工
在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数
在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数
主包准备的是文档推荐的开源数据集。: [0:500]原始 AISBench summary accuracy = 91.60% Post=500,Received=496,Failed=4,empty prediction=8。对 8 条空预测样本进行手动补跑后,5 条补跑正确,修正 accuracy = 92.60%。1. max_out_len 太小会导致模型只返回 reasoning,con







