logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

我构建了一个带验证的AI数学系统,它输给了裸LLM进展篇

本文是一个有完整实验链条支持的否定性结果:我们系统性地证明,在 deepseek-chat + 高中一元二次函数范围内,“分解→求解→验证→组合"的多智能体架构无法超越裸LLM的单次调用,并建立了8种失败模式的分类学和信任分层的设计原则。系统的死法:子任务全过(推理文本也对),但组合器写 boxed 答案时把"整个区间"缩成了"0或2"。证据:对抗实验里 LLM 生成的标准答案 3/5 是错的(P

文章图片
#人工智能#抽象代数
到底了