logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型性能测试指南

输入:5000字PDF合同 → 要求生成300字摘要评估:ROUGE-L 分数关键条款覆盖率显存占用(是否OOM)是否截断上下文🎯大模型性能测试 = 技术指标 × 业务价值 × 用户体验 × 成本控制不要追求“全能冠军”,而要寻找“最适合你业务场景的最优解”。📌附录:常用开源评测数据集HELM– 全面评估框架C-Eval– 中文知识评测AGIEval– 人类考试题评测LiveBench– 动态

#测试工具
大模型测试脚本

模型的完整性能测试脚本(Python),涵盖:✅ 推理延迟 & 吞吐量✅ Token 生成速度✅ 显存占用监控✅ 多轮对话 & 长文本支持✅ 自动化质量评估(可选)✅ 压力并发测试(使用 Locust)

#人工智能
大模型赋能软件测试

传统痛点:报告数据堆砌,缺乏洞察。大模型能力自动生成自然语言摘要:“本次回归发现3个P0缺陷,集中在支付模块,建议优先修复”;对比多轮测试趋势,预警质量风险;输出给非技术人员的“业务影响说明”。✅ 工具示例:Allure + LLM 插件、Jenkins AI Reporter、自研 LangChain 报告引擎大模型正在重构软件测试的“生产力内核”——从“人驱动工具”变为“AI理解意图、自主执行

#人工智能
多模态AI大模型驱动视觉需求测试

为中枢,打通“需求文档(文本)→设计稿/界面截图(图像)→测试用例(文本)→自动化脚本(代码)→执行结果(图像+文本)”的全链路,实现“输入需求即可自动完成测试”的智能化闭环。优化Prompt模板(如明确“误差容忍范围”“特殊场景忽略规则”),提升大模型输出准确性(例如:对动态验证码区域标注“无需测试”)。:异常类型(颜色错误/尺寸偏差/跳转失败)、截图对比(实际vs预期)、根因推测(如“前端CS

#测试工具
AI 大模型进行 CodeReview

基于需求中明确的前提,AI大模型需聚焦等核心维度,通过实现精准评审。

#人工智能
大模型微调与预训练的区别

预训练模型虽然“博学”,但存在两大问题:预训练是“从0到1造模型”,让模型“知道是什么”(通用知识);微调是“从1到N改模型”,让模型“擅长做什么”(特定任务/领域)。

#人工智能
大模型测试方法

先搭建核心测试环境(API接入、测试数据集、基础工具如Postman/JMeter);设计并执行P0级用例(核心功能+安全性+合规性),确保无致命风险;搭建自动化框架(LangChain/Pytest+OpenAI Evals),覆盖重复测试场景;开展性能与专项测试(并发、跨端、多模态);沉淀测试资产(用例库、数据集、自动化脚本、报告模板),支持迭代测试。通过以上体系化方案,可快速切入豆包大模型测

#测试工具
DevOps 流水线

通过这套流水线,企业可实现“代码提交→构建→测试→部署→监控”的全流程自动化,大幅缩短交付周期,同时保证交付质量。

#devops
微服务架构下进行混沌工程的实施

业务优先:所有故障场景围绕“核心业务韧性”设计,不追求“技术炫技”;安全可控:始终控制故障范围,避免影响真实用户,必备熔断和回滚机制;依赖观测:没有可观测性平台,就没有混沌工程——必须能实时看到故障影响;持续迭代:微服务架构在变,故障场景也在变,需每月更新场景库、每季度复盘优化。通过这套流程,可逐步提升微服务的“抗故障能力”,让系统从“被动应对故障”变为“主动预防故障”。

#测试工具
微服务混沌工程场景执行清单

本清单聚焦微服务高频故障场景,按“网络/服务/中间件/资源/第三方依赖”分类,每个场景包含“目标→前置条件→执行步骤→回滚方案→验证指标”,确保落地可操作,默认使用开源工具(Chaos Mesh/Blade),适配K8s容器化环境。

#测试工具
    共 200 条
  • 1
  • 2
  • 3
  • 20
  • 请选择