logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen Thinking 模型进行 CEval 评测时 content=null 的问题定位与解决(小白暑期实习日常实录~)

在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数

#linux#服务器#学习
Qwen3.6 系列大语言模型统一严格评测与自适应补跑(暑期实习Task1)

本次工作面向 Qwen3.6 系列大语言模型开展统一精度评测,评测对象包括 Qwen3.6-27B-W8A8 量化模型、Qwen3.6-27B-BF16 全精度模型以及 Qwen3.6-35B-A3B 混合专家模型,评测数据集包括 CEval 金融法律六科、BoolQ 和 GSM8K。针对大语言模型在 thinking 模式下可能因最大输出长度不足而产生的空预测、推理截断和最终答案缺失问题,本次工

#人工智能#算法#机器学习 +2
Qwen Thinking 模型进行 CEval 评测时 content=null 的问题定位与解决(小白暑期实习日常实录~)

在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数

#linux#服务器#学习
Qwen Thinking 模型进行 CEval 评测时 content=null 的问题定位与解决(小白暑期实习日常实录~)

在昇腾环境中,我使用 AISBench 通过 OpenAI-compatible vLLM API,对 Qwen3.6-35B-A3B 模型进行能力评测。在完成 BoolQ 和 GSM8K 后,mentor 希望进一步评价模型在中文金融、经济和法律专业知识方面的表现,因此从 CEval 中选择了六个相关子任务:六科验证集共计 233 道单项选择题,评价指标为 Accuracy。3. CEval 数

#linux#服务器#学习
ARM Linux + Ascend NPU 环境下基于 vLLM API 的 AISBench 遇到的实际问题实录~

主包准备的是文档推荐的开源数据集。: [0:500]原始 AISBench summary accuracy = 91.60% Post=500,Received=496,Failed=4,empty prediction=8。对 8 条空预测样本进行手动补跑后,5 条补跑正确,修正 accuracy = 92.60%。1. max_out_len 太小会导致模型只返回 reasoning,con

#linux#服务器#python
到底了