登录社区云,与社区用户共同成长
邀请您加入社区
缓存成本降75%,科研跑分翻倍
Anthropic发布新一代旗舰模型ClaudeOpus5,以"更周到、更主动"为定位,多项任务能力接近Fable5前沿水平,综合使用成本仅后者一半。Opus5在编程、知识工作、自动化流程等方面实现显著提升,尤其在长周期软件工程和代码质量测试中表现突出,具备承接大型项目的能力。其核心优势在于任务执行效率提升,能以更低成本完成复杂任务。模型还展示了在科研可视化、生物数据分析等领域
阿里云通义千问推出Qwen3.8-Max-Preview模型,开创大模型"日更迭代"新模式。该模型采用2.4万亿参数MoE架构,支持百万token长文本处理,具备领先的UI还原和前端代码生成能力。其最大突破在于通过每日无感升级实现动态进化,打破行业季度更新的传统节奏,使AI首次具备持续自我优化能力。官方确认该模型将经历预览测试后开源,推动国产开源生态发展。这一创新标志着AI竞争
AI命令行工具正在成为开发者日常提效的标配,但便捷背后的数据边界始终模糊不清。
2026年7月11日,重磅披露一则震动全球AI圈的安全事故:OpenAI刚发布仅2天的旗舰模型GPT-5.6 Sol曝出毁灭性高危Bug,本地智能体在自主执行任务时,会随机触发本地文件强制删除操作,删除数据几乎无恢复可能。在Matt发声后,大量参与内测的开发者接连自爆遭遇同类问题:模型在执行文件整理、日志清理、项目打包等常规任务时,会绕过预设文件夹范围,调用unlink、find -delete等
OpenAI推出GPT-5.6模型家族,采用Sol(旗舰)、Terra(均衡)、Luna(轻量)三级架构,标志着大模型发展从单一性能竞争转向系统化分工。新版本强化了Agent工作流能力,支持复杂任务拆解、工具调用和结果校验,同时引入提示词缓存等成本优化机制。模型定价分层明显(Sol $5/百万token,Luna $1/百万token),强调根据任务需求合理配置资源。目前以受限预览形式逐步开放,重
Google推出多模态AI模型Gemini 3.5 Flash,具备100万token上下文窗口和64K输出上限,支持文本、图像、音频、视频输入。该模型在智能体编程、真实世界任务和多模态理解方面超越前代Pro版本,速度达每秒290个token,成本仅为竞争产品的三分之一。虽然Flash在多数任务上表现优异,但在极限推理和长上下文任务中仍略逊于Pro版本。同时,Google还发布了视频生成模型Gem
DeepSeek发布全新V4系列模型,推出Pro和Flash两个版本。V4-Pro性能媲美顶级闭源模型,在Agent能力、世界知识和推理性能方面表现突出,支持1M超长上下文处理。V4-Flash则是更经济的版本,适合日常场景。新模型采用创新的注意力机制,显著降低长上下文处理的资源消耗。API服务已同步更新,旧接口将在三个月后停用。DeepSeek坚持开源策略,让开发者自由使用这些先进技术。
本文提出利用RAG技术为AI对话系统添加记忆功能,通过本地JSON文件存储聊天记录,并基于向量相似度检索相关对话片段。该方法包含四个核心模块:记忆存储模块实现JSON文件读写;向量化模块调用云端API将文本转为向量;检索模块计算余弦相似度获取相关记忆;生成模块将检索结果融入提示词。该方案有效解决传统无状态系统的"遗忘"问题,使用Python实现云端API调用,降低了开发门槛,使AI在长对话中保持连
Opus4.7版本在性能上有所提升,主要改进包括:软件工程能力(SWE-bench得分提升6.8%)、视觉推理能力(XBOW测试从54.5%跃升至98.5%)和多学科推理能力。新版本采用新tokenizer,输入token数增加1.0-1.35倍,但价格不变。新增xhigh档位和/ultrareview命令,优化了成本控制和代码审查。虽然部分测试如AgenticSearch得分略有下降,但整体性能
GeoPixel:首个支持像素级接地的高分辨率遥感多模态模型 针对现有大型多模态模型在遥感领域表现不足的问题,研究人员提出了GeoPixel模型。该模型突破了三大技术瓶颈:1)通过自适应分割和特征融合模块处理4K高分辨率图像;2)首创端到端像素级接地能力,可生成精确分割掩码;3)构建了包含53,816个接地短语的大规模数据集。GeoPixel采用动态图像分割策略,结合视觉编码器和轻量级像素解码器,
本文重点介绍了AI编程工具ClaudeCode的两大核心功能模块。入门实操部分包含IDE插件整合、高频指令速查表、CLAUDE.md配置管理、图片解析和自动化模式等实用技巧。会话管控模块则详细讲解了上下文清理、快捷键操作、中断恢复、会话压缩以及自定义命令设置等提升效率的方法。通过系统掌握这些功能,开发者可显著提升编程效率,实现自动化工作流管理。文章后续还将深入探讨提示优化、实战应用等进阶内容。
平台自带网页版工具,无需下载任何软件,浏览器点开就能用,纯新手友好,适合零基础用户快速上手部署。全局安装 OpenClaw,创建专属目录并初始化,选择 QuickStart 模式,输入 API Key,默认 8080 端口,务必保存生成的访问 Token。(2)推荐阿里云百炼:国内节点组网,和烁智云服务器网络互通,延迟低、不掉线、审核合规,相比海外模型密钥,不会出现调用失败、超时报错的问题,全程部
龙虾智能体虽强,但安全漏洞可能让你付出惨痛代价——API Key被窃、服务器被黑、重要文件误删、第三方技能暗藏后门……本文根据资深玩家总结的5大安全原则,提供可直接复制的代码配置方案
对话记忆机制是 AI 实现持续交互的关键。而MCP 协议打破了 AI 的封闭状态,让其具备操控外部世界的能力,作为模型与工具对接的标准化开源协议,MCP统一了二者的连接标准,让A掌握了主动调动外部工具执行任务的能力。Skills 流程规划则规范了 AI 的工具使用逻辑,即便拥有工具调用能力,AI 也难以自主把握工具使用顺序与执行流程,容易出现操作混乱、任务失败的问题,Skills 作为结构化的操作
若本地已部署 Trae、Qoder、Claude Code、OpenCode、Codex 等智能体工具,可将待安装组件清单及相关文档链接提交至智能体,由其自动完成安装流程。支持 Windows、macOS、Linux 多平台部署,其核心特点在于,OpenClaw 服务的运行仅占用本地计算资源,软件本体可免费永久使用,完成安装后即可长期使用。上述社区资源均具有较高的实用价值,熟练掌握并实践相关内容后
OpenAI发布GPT-5.4,专为专业工作负载打造,在编程、知识工作和计算机操作方面表现突出。该模型具备1MToken长上下文支持,原生计算机操作能力,在GDPval测试中83%案例优于前代。新增工具搜索功能降低47%Token消耗,联网搜索能力提升17%。GPT-5.4Pro版本针对复杂任务提供极致性能,在BrowseComp基准达89.3%新高。CEO奥特曼称赞其个性化和专业能力提升,标志着
本期深入探讨如何优化ClaudeCode使用体验:通过CLAUDE.md文件定制编码规范,确保AI生成的代码符合项目要求;介绍MCP扩展功能,连接数据库、GitHub等外部服务;分享高效命令行操作技巧,如自动提交代码和大批量重构。这些方法能显著提升开发效率,让AI更好地融入实际工作流程。
MoE-Lightning的 发现的问题 是,在资源受限(即显存无法容纳完整模型权重)的平台上部署大型混合专家(MoE)模型时,现有的卸载(Offloading)系统由于未能有效重叠计算任务与CPU-GPU之间的大量数据传输,导致I/O利用率低下且流水线中存在大量气泡,从而使得推理吞吐量严重不足。MoE-Lightning的 核心观点 是:通过一种细粒度的管道调度策略来最大化计算与I/O的重叠,并
2026年2月,Anthropic公司发布Claude Sonnet 4.6模型,引发行业震动。该模型在计算机操作、长文本推理等六大领域实现重大突破,OSWorld测试成绩达72.5%,能像人类一样操作办公软件。在多项基准测试中,其表现超越Gemini 3Pro和GPT-5.2,部分能力甚至超过自家旗舰Opus 4.6。新模型支持百万级上下文窗口,显著提升开发效率,导致多家传统软件公司股价应声下跌
Google DeepMind低调推出Gemini 3.1 Pro预览版,该模型在推理能力上实现重大突破,ARC-AGI-2基准得分达77.1%,较前代提升两倍多。新版本支持百万级tokens上下文、多模态输入,并能直接生成网页动画SVG。AI工程师盛赞其解决了前代工具调用弱、幻觉多的问题,在终端工具调用和抽象推理方面达到SOTA水平,性价比远超竞品。实际案例显示,该模型可完美处理复杂三角学运算和
阿里在2026年春节前夕低调开源了Qwen3.5-397B-A17B模型,这是目前参数规模最大(3970亿)的MoE多模态模型之一。该模型采用高效MoE设计,仅激活17亿参数,推理速度比前代快8-19倍,显存需求更低且API价格实惠。作为原生多模态模型,它支持文本、图像、视频和GUI理解,具备201种语言处理能力,在视觉Agent、视频理解和长文档处理等场景表现突出。模型还创新性地整合了"
智谱AI发布新一代开源模型GLM-5,专为智能体工程优化,参数规模达744B,采用创新异步强化学习框架和稀疏注意力机制,编程能力接近Claude Opus 4.5。在SWE-bench等测试中取得开源模型最高分77.8%,擅长复杂系统构建与长序列任务。实际应用展示其出色的多步执行能力,被视作通用智能Agent的理想基座。该模型发布后引发开发者社区热议,并推动智谱港股上涨)
《神秘AI模型"PonyAlpha"身份揭晓:中国智谱GLM-5的惊艳亮相》 2月7日,匿名AI模型"PonyAlpha"在OpenRouter平台悄然上线,凭借卓越的编程能力和逻辑密度引发全球开发者热议。在48小时内,该模型展现出秒级重构复杂代码、生成完整网页应用等惊人能力,引发关于其出身的四大猜想:Claude派、DeepSeek派、Grok派和GLM派
Claude Opus 4.6 在海量文档的相关信息检索上表现更优,该能力亦延伸至长上下文任务中,可在数十万 Token 范围内稳定保存并追踪信息,上下文漂移现象显著减少,还能捕捉到此前 Opus 4.5 未能识别的深层细节。此外,Claude Opus 4.6 为首款支持 100 万 Token 上下文的 Opus 级模型,针对超过 200k Token 的提示词,将按高级费率计费,即输入与输出
按照官网的定义,它是一个“真正能干活”的 AI。它的一个重要特点是 持久化记忆:能记住你的偏好、上下文和习惯,不用每次重复解释,如同一位真正的私人助理。但与此同时,它的权限也非常大:可以浏览网页、填写表单、从网站抓取数据、读写本地文件、执行 Shell 命令和脚本。因此,强烈不建议直接部署在主力机上,尤其是在早期阶段。拥有这个私人秘书只需发条信息,它便可以后台执行并将执行过程实时截图供你监督。比如
传统软件工程师何去何从
Step-DeepResearch是阶跃星辰推出的320亿参数深度研究智能体模型,通过创新的单智能体架构和原子能力训练法,实现了从信息检索到报告生成的全闭环研究流程。该模型采用动态循环机制,将研究任务分解为规划、检索、验证和生成四个原子能力,并构建了2000万+高质量文档库和权威站点索引系统。在评测中,其表现仅次于GeminiDeepResearch,在引用和沟通质量维度达到行业最高水平,同时部署