logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

本地代码大模型评测实战(一):9个模型、316道题、一张改装显卡

本地代码大模型评测实战摘要 本次评测对比了9个代码大模型在316道编程题目上的表现,包含本地部署和云端API模型。关键发现: 性能排名:DeepSeek V4 Pro(API)以66.6%通过率领先,本地模型ThinkingCap-Qwen3.6-27B(Q4_K_M)以59.5%居首,PrismML-Ternary-Bonsai-27B(Q2_0)以50.5%通过率仅需7GB显存。 硬件方案:使

文章图片
#人工智能
本地代码大模型评测实战(四):8个坑和1个崩溃

坑发现难度修复成本一句话解法1思维循环高中流式输出+滑动窗口检测器2mmap双重映射中低--no-mmap(仅Windows)3DRY采样器高低移除所有惩罚参数4中低移除5Windows SSH进程中高在桌面session运行bat6GBK编码低低7中低用PrismML的llama.cpp fork8CUDA版本低低放对应版本DLL到程序目录先花半天时间搭好崩溃恢复和日志系统,再开始跑评测。

文章图片
#人工智能
本地代码大模型评测实战(三):测试数据告诉我的13件事

第一,失败不是均匀的。模型在不会做的题上花更多时间、写更长代码、推理更久——所有"失败"的信号都指向同一个行为模式:死磕。这对推理服务的成本模型有直接影响。第二,评测的噪声比你想的大。12% 的翻转率、17 道分歧题、19 道全难题——任何声称"模型 A 比模型 B 强 X%"的结论,都需要考虑这些噪声源。单次跑分的置信度远低于你的想象。第三,能力是多维的。修 bug 和写代码是两种能力,思维链在

文章图片
#人工智能
本地代码大模型评测实战(五):公平对比的5个陷阱

摘要(149字): 模型评测中的公平对比存在5个关键陷阱:1)思维模式差异导致能力评估偏差;2)错误处理方式不同造成通过率失真;3)单次运行的随机方差影响排名;4)训练数据泄露导致分数虚高;5)小样本量带来的统计不显著。评测时应统一思维模式设置、规范错误处理、多次运行取均值、使用时间切分的题目并扩大样本量。真正可靠的比较需要同时报告严格/宽松通过率、置信区间和错误明细,避免被表面数字误导。评测方法

#人工智能
本地代码大模型评测实战(二):评测框架

本文评测了本地代码大模型PrismML-Ternary-Bonsai-27B在DebugBench上的修bug能力表现。关键发现:1)模型修bug通过率62.2%,比从零写代码高18个百分点;2)Easy题96.7%通过率,但Hard题降至53.2%;3)语法和逻辑错误修复率接近(79%),但多重错误处理较差(66.5%);4)76%的失败源于遗漏import等简单问题。结论表明模型擅长模式识别式

文章图片
#人工智能
SmartDNS nftset 多目标写入:从 Bug 到 PR 合并的完整路径

gnome-shell 每次 ACPI resume 后必现 segfault 2026-06-02 Fedora 44 AMD Phoenix APU (Radeon 780M) 一、故障现象原始日志解读 dmesg 里的原始一行: 逐字段拆开: error 5 的含义:x86\64 page f...gnome-shell 每次 ACPI resume 后必现 segfault 2026-06

#网络
sing-box 透明网关冻结:从 SIGQUIT Goroutine Dump 定位三重自锁 Bug

gnome-shell 每次 ACPI resume 后必现 segfault 2026-06-02 Fedora 44 AMD Phoenix APU (Radeon 780M) 一、故障现象原始日志解读 dmesg 里的原始一行: 逐字段拆开: error 5 的含义:x86\64 page f...gnome-shell 每次 ACPI resume 后必现 segfault 2026-06

DeepSeek Anthropic 端点协议转换缺陷分析:为什么它在 Claude Code 上表现不佳

摘要 DeepSeek 提供的 Anthropic 兼容端点 () 在协议转换层面存在若干字段级缺陷,导致在使用 Claude Code 等重度依赖 Anthropic 协议的客户端时,跨文件推理能力、工具调用可靠性、以及多轮会话成本显著劣于官方端点。本文通过三阶段递进分析——受控 A/B 对照实验...

#AI
Claude Code + DeepSeek: role:system 400 错误的诊断与修复

文章摘要: Claude Code升级到v2.1.156后,claude-deepseek命令返回400错误,提示"unknown variant 'system'",而其他三家服务商工作正常。经排查发现,Claude Code新版本对所有服务商都会发送含role: "system"的消息,但DeepSeek的API端点对此校验更严格。为解决此问题,开发了一个本地代理服务,在请求到达DeepSee

#AI
解决win10系统 L2TP连接尝试失败:ERROR因为安全层在初始化与远程计算机的协商时遇到了一个处理错误

错误描述:当连接VPN是回传错误为“ L2TP连接尝试失败,因为安全层在初始化与远程计算机的协商时遇到了一个处理错误”操作系统:win10家庭版VPN设置:常规选项:配置了需要连接目标server的IP地址。安全选项:VPN类型如下图所示网络选项:在ipv4属性中配置如下:高级选项IP设置中取消了“在远程网络上使用默认网关”然后链接时报错。因为不了解VPN服务器的配置

#操作系统#服务器#安全
    共 16 条
  • 1
  • 2
  • 请选择