
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
所以"在你的指挥下(under your direction)"这句话不是客套——你给它多大权限、让它碰哪些数据,决定了它的能力边界,也决定了风险边界。每一步都慢一点,整体体验就会拖成"龟速"。官方说法是,3.5 Flash 在多个维度上的智能水平已经能与大型旗舰模型相媲美,并且是迄今最强的代理与编码模型,在有挑战性的编码与代理类测试上超过了上一代的 Gemini 3.1 Pro。如果你做产品,值

我们一直以为"让模型多想一会儿"只有好处,但近期一篇论文给出了反直觉的结论:当你强化大模型(Large Language Model, LLM)的推理能力时,它在调用工具时反而更容易"一本正经地胡来"。但当你让他去库房取东西时,他会因为"想得太多"而脑补出一个根本不存在的货架编号,然后信誓旦旦地告诉你"东西就在 B7"。最简单有效的一招是白名单校验:模型说要调某个工具,先在代码里查这个工具名和参数

基于刚刚发布的 DSpark 论文,用人话拆解推测解码(Speculative Decoding)的核心原理——大模型"先猜后验"的加速机制、半自回归生成与置信度调度的创新点,以及这些技术对普通用户和开发者意味着什么。

基于 Addy Osmani《The Orchestration Tax》,拆解多 Agent 编排的四种隐藏成本,给出三种降低编排税的实战模式(合同先行、接力赛、双 Agent 制衡),每种模式附可运行的 Shell 配置模板和模式选择决策树。

Hugging Face 开源了 ml-intern——一个把 LLM 后训练(post-training)整条流水线自动化的智能体:从数据清洗、SFT、评测到产出报告,它能像一个"会干活的实习生"一样把跑实验的脏活接走。正确姿势是:用它生成和执行流水线、用上面的最小脚本验证地基、用踩坑清单兜底,把人留在"review 和决策"的关键节点上。的胶水活:把杂乱的对话数据整理成统一格式、配一份不出错的

摘要:Claude Code提供五层自动化开发实践:1)上下文管理(CLAUDE.md记录项目规范);2)五种工作流模式(根据任务复杂度选择);3)Hooks自动化质量检查;4)无人值守调度任务;5)MCP服务器集成企业工具链。Anthropic实测显示,该方案显著提升开发效率,调试时间缩短80%以上,使团队能独立完成功能开发。提示词优化可进一步提升自动化效果。

本文介绍了一种基于NAS部署的agentmemory服务器架构方案,主要特点如下: 采用集中式部署模式,在NAS上运行全功能agentmemory服务器,数据存储在/data卷中,多设备通过Tailscale共享访问。

2026 年 6 月 9 日,Anthropic 发布了 Claude Fable 5 和 Claude Mythos 5 两款新模型,定位为"最难的智力工作与编程问题的下一代智能"。这符合 Anthropic 一贯强调的"有用、诚实、无害"方向,特别是在教育、法律、金融等需要透明推理的领域。值得注意的是,两条线都是"5"代,暗示它们共享同一代基础架构,但在训练数据、对齐方式和推理策略上做了差异化

基于 Addy Osmani 最新博文《Agentic Code Review》的思路,从零搭建 AI 驱动的代码审查流水线——Claude Code 作为审查引擎,Git pre-push hook 触发,自动检查安全性、逻辑和风格问题,附完整可运行脚本。

基于 Addy Osmani 与 Google 合著的《The New Software Lifecycle》白皮书,从零搭建 Claude Code 驱动的自动化开发流水线——覆盖 Skills、Worktrees、Automation、Plugins、Sub-agents 五个 Harness 组件,附完整 Shell 脚本和 GitHub Actions 配置。








