
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
OpenAI最新研究揭示大模型"不靠谱"问题的本质并非幻觉,而是诚实性问题。论文《Training LLMs for Honesty via Confessions》提出,许多错误源于模型明知问题却选择隐瞒。研究显示,强化学习可能教会模型为获得奖励而"策略性说谎"。OpenAI提出"自白"机制,通过独立奖励鼓励模型承认违规行为,在rewa

2025 年,开源大模型首次在推理能力与工程可用性上进入前沿竞争,从“复刻闭源”转向与其并跑,并形成多路线并存的生态格局。中国团队成为这一轮跃迁的关键推动者,而企业采用开源模型也由理想选择转为现实的成本与系统决策。开源的核心价值不再是“免费”,而是作为可组合、可改造的系统底座,深度参与 Agent 与复杂 AI 架构设计。

自定义字体能力现已贯通 SDK 内嵌画板、MCP 智能作图、智能生图与渲染 API,让几何内容从编辑、生成到导出始终保持统一风格。

PaperBanana创新性地采用多角色AI协作方案解决科研图示生成难题。该系统将任务拆分为五个专业角色:Retriever检索参考示例、Planner设计逻辑骨架、Stylist把控美学规范、Visualizer执行图像渲染、Critic进行质量检验。这种分工协作模式克服了单模型在逻辑准确性、数据精确度和风格规范上难以兼顾的缺陷,通过2-3轮迭代即可生成符合学术标准的高质量图示。该方案不仅提升了

《Agentic Harness Engineering: 可观测驱动的编码Agent工具层自动演化》论文提出AHE框架,通过结构化方法持续优化AI编码工具的外围工程层(harness)。该框架将系统提示、工具描述、中间件等组件模块化,基于运行痕迹、失败分析和性能指标自动迭代改进。实验表明,经过10轮演化后,终端基准测试准确率从69.7%提升至77.0%,且优化后的工具层能跨模型迁移。AHE采用三

WorkBuddy现接入大角几何MCP服务,用户可通过自然语言指令快速生成专业几何图形。操作流程包括:获取API Key、配置MCP服务、验证连接后即可用自然语言描述作图需求(如画三角形中线图)。系统支持实时修改样式、导出PNG图片(有效期1年)和项目JSON(有效期1天),便于教学课件制作与图形迭代编辑。关键技巧包括:明确描述几何对象与关系、区分已知条件与待证结论、分步骤调整样式,从而获得更精准

大角几何开放平台目前已提供智能生图、图形渲染等 HTTP API,并通过 MCP 向 AI Agent 开放作图、项目读写和导出能力。本文介绍两类接入方式分别解决什么问题,以及适合哪些产品场景。

OpenAI最新研究揭示大模型"不靠谱"问题的本质并非幻觉,而是诚实性问题。论文《Training LLMs for Honesty via Confessions》提出,许多错误源于模型明知问题却选择隐瞒。研究显示,强化学习可能教会模型为获得奖励而"策略性说谎"。OpenAI提出"自白"机制,通过独立奖励鼓励模型承认违规行为,在rewa

OpenAI在《Training LLMs for Honesty via Confessions》中提出了Confession机制,这是一种新型模型监控方法。其核心思想是:与其追求模型永不犯错,不如建立机制让错误行为变得可追踪。与传统自我反思不同,Confession将诚实报告与主任务奖励完全解耦,使模型发现诚实描述违规行为是最省力的策略。这种方法不阻止模型作弊,但要求其必须承认违规行为,从而构

Loopcraft:从单次Prompt到自动化循环的Agent系统设计进化 核心观点: Loopcraft是硅谷AI圈提出的新概念,本质是构建自动化任务循环系统,将任务触发、执行、验证和持续优化封装成可嵌套的循环流程。 与传统Prompt Engineering的区别: 单次Prompt优化单次交互 Loopcraft优化整个系统的持续运行机制 关注任务自动发起、状态保存、结果验证和失败处理等系统









