logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

给Qwen3.8换修复版对话模板, 从reasoning_effort: 400到Agent自愈的实战完善

本文介绍了针对Qwen3.8模型在Agent场景下使用官方对话模板时遇到的问题及解决方案。主要问题包括:1)reasoning_effort值限制导致非标准输入返回400错误;2)空思考渲染导致Agent循环早停;3)工具调用参数处理和错误恢复机制不完善。作者采用社区修复版模板Qwen-Fixed-Chat-Templates v22并进行扩展(v22.1),新增了effort值映射表和两个开关。

dsh Web 局域网访问解密:从「0.0.0.0 被拒」到 TLS 反代打通全内网

本文介绍了如何安全地将DeepSeek Harness CLI(dsh)的Web UI通过局域网开放访问的全过程。作者首先定位到dsh出于安全考虑禁用了绑定0.0.0.0的功能,但通过分析源码发现安全验证机制已为局域网访问做好底层支持。通过创建个人profile配置(~/.dsh/profiles/web/cordis.patch.yml)设置host为0.0.0.0,成功绕过命令行参数检查,同时

Qwen3.8-27B双卡A800部署指南

Qwen3.8-27B双卡A800部署与性能分析 摘要 本文详细介绍了在双A800 80GB GPU上部署Qwen3.8-27B大语言模型的技术方案。针对Ampere架构(A800 sm80)无FP8张量核的特点,通过对比测试验证了BF16原生精度在速度上的优势(预填充快14-25%),同时分析了该模型混合注意力架构(16层全注意+48层线性注意)带来的KV缓存优化效果。部署采用vLLM v0.2

当LLM Agent遇上真实渗透测试:从失败分类到难度感知规划的系统性突破

当LLM Agent遇上真实渗透测试:从失败分类到难度感知规划的系统性突破

#人工智能
Agent强化学习训练框架Microsoft Agent-Lightning之实战记录

本文介绍了基于Microsoft Agent-Lightning框架的SQL-Agent强化学习训练全流程。使用4×NVIDIA A800 GPU环境,通过GRPO算法对Qwen3-1.7B模型进行训练,提升其文本转SQL能力。文章详细说明了项目结构、Spider数据集准备、模型下载与配置优化,并提供了防止OOM的关键参数设置(如gpu_memory_utilization=0.6)。训练采用La

Docker+NVIDIA Container Toolkit+Ray+双3090容器transformer数据并行模式分布式联合运行Qwen3-4B-Instruct-2507模型

Docker+NVIDIA Container Toolkit+Ray+双3090容器transformer数据并行模式分布式联合运行Qwen3-4B-Instruct-2507模型

文章图片
#docker#transformer#分布式
RLHF(基于人类反馈的强化学习)

RLHF(基于人类反馈的强化学习)

文章图片
#人工智能
Agent强化学习训练框架Microsoft Agent-Lightning之训练环境部署

本文档详细记录了在Ubuntu 22.04系统上部署Agent-Lightning环境的完整流程。关键点包括:使用conda创建Python 3.12环境;安装特定版本的torch、vllm等核心组件;通过预编译wheel安装flash-attn以避免本地编译;解决了三个常见环境问题(libstdc++版本冲突、fastapi兼容性问题、transformers版本限制)。文档还提供了项目目录结构

GPTQ大模型量化端到端实战:校准、压缩与部署评估通用流程

GPTQ大模型量化端到端实战:校准、压缩与部署评估通用流程

文章图片
    共 349 条
  • 1
  • 2
  • 3
  • 35
  • 请选择