logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

正面硬刚Claude Opus 4.6,OpenAI 当天发布GPT-5.3-Codex,谁强?

如果你需要深度的逻辑分析、写长篇的技术文档、或者重构核心算法,去抱 Claude Opus 4.6 的大腿,它的细腻和严谨目前无人能敌。如果你需要快速构建产品原型(MVP)、搭建全栈应用、或者需要一个能帮你操作服务器、跑脚本的“全能干事”,GPT-5.3-Codex 绝对会让你爽到飞起。

文章图片
我用3秒钟音频克隆了自己的声音——阿里开源 Qwen3-TTS 全家桶

阿里开源Qwen3-TTS语音模型引发热议,其97ms超低延迟和精准音色克隆能力令人惊艳。该模型采用Dual-Track双轨建模技术,实现"话音刚落,回应即至"的流畅交互体验。创新的12Hz Tokenizer保留副语言细节,非DiT架构在保证音质的同时降低算力需求。更支持自然语言控制语音风格,并能从零创造音色。开源1.7B和0.6B两个版本,支持10种语言,让开发者能以低成本

文章图片
#人工智能
Apple工程师亲自调教的美学AI:基于Qwen3-Coder的 UI 设计超越 GPT5

摘要:阿里云Qwen3-Coder在UI设计生成任务中超越GPT-5引发行业关注。研究表明,通过181个设计师的草图反馈微调后,这个30B参数的开源模型展现出惊人的美学理解能力。Apple团队发现设计师直接修改界面的方式比传统评分更有效,一致性从49.2%提升至76.1%。这项突破揭示了高质量数据比模型规模更重要,也展现了中国开源AI的进步。未来,AI可能成为设计师的创意助手而非替代者,通过人机协

文章图片
#人工智能
从 0 搭建 Claude Code:一个工具,一个 Handler,Agent 工具扩展之道

本文介绍了一种通过DispatchMap模式扩展AI Agent工具能力的方法。核心思路是保持主循环不变,通过字典映射将工具名与处理函数关联,实现零成本工具扩展。文章详细解析了路径沙箱(safe_path)安全机制、四个专用工具(read/write/edit文件及bash)的实现,以及如何通过TOOL_HANDLERS字典实现工具分发。这种设计遵循开放-封闭原则,新增工具只需注册到字典而无需修改

文章图片
#人工智能#深度学习
Claude 官方 Harness 发布——从 LLM 到 Agent 一次理清 AI 设施概念层次

摘要:Harness是Anthropic推出的托管智能体运行框架,它重新定义了AI应用开发方式。作为连接LLM与现实世界的"操作系统",Harness解决了传统Agent开发中80%的基础设施构建难题,包括工具调用、状态管理、异常处理等。系统包含四大核心概念:Agent(配置定义)、Environment(运行容器)、Session(任务实例)和Events(通信单元)。通过与

文章图片
#人工智能#自然语言处理#深度学习
Claude Mythos 什么时候来?关于Anthropic 下一代模型我们知多少?

摘要: Anthropic推出超越Opus的全新AI模型Claude Mythos,专注于自主发现和修复软件漏洞,但因能力过强且存在潜在风险,目前仅限特定安全机构和关键基础设施运营商使用。Mythos在测试中发现超2.3万个漏洞(含6202个高危漏洞),效率远超前代模型90倍。Anthropic计划逐步开放Mythos API,定价为Opus的5倍,同时宣布秘密提交万亿美元估值IPO申请。这一突破

文章图片
#深度学习#人工智能#神经网络
Claude Code 的七层架构:Anthropic 如何重新定义 AI 编程的上限

文章摘要 Anthropic突破性地构建了七层AI编程架构ClaudeCode,系统性解决大型代码库的协作难题。该架构通过CLAUDE.md实现持久上下文记忆,利用Hooks设置安全边界,整合Skills封装专业知识,结合LSP提升代码理解精度,通过MCP协议对接开发环境,运用子代理并行处理复杂任务。这种分层设计让AI从"智能补全"进化为"全栈协作者",开发

文章图片
#人工智能#MCP
Claude code 滚屏到凌晨!如何构建一个不会失控的 Agentic Loop?

文章摘要:Agentic Loop(自主循环)的执行关键在于预设明确的停止机制,避免失控和资源浪费。核心设计包括:1) 明确定义任务范围与可验证的成功条件;2) 在每轮迭代中嵌入三层验证(动作/迭代/终止);3) 设置预算上限和重试限制;4) 编写清晰的停止条件(成功/失败/预算)。推荐测试驱动、差异评审和检查点摘要三种循环模式,强调外部验证优于模型自判。真正的挑战在于提前设计终止逻辑,而非技术实

文章图片
#人工智能#神经网络#深度学习
虚拟现实结合,Gemini Omni Flash 编辑视频模板案例 + 代码实战

摘要:Google DeepMind于2026年6月30日推出Gemini OmniFlash视频生成模型(ID:gemini-omni-flash-preview),支持多模态输入与对话式视频编辑。用户可通过文字、图片或视频混合输入生成10秒动态内容,并能通过自然语言指令实时修改(如调整灯光、替换文字等),无需重新生成完整视频。该模型定价0.10美元/秒,与Veo 3.1 Fast持平,但增加了

文章图片
#人工智能#神经网络#深度学习 +1
Nemotron 3.5 ASR:0.6B 参数,NVIDIA 开源 CPU 终端流式语音识别模型

NVIDIA低调发布Nemotron3.5ASR流式语音识别模型,600M参数支持40种语言,采用Cache-Aware架构显著提升流式推理效率。相比Whisper需重复计算的问题,该模型通过缓存机制实现严格非重叠计算,在A10G显卡上支持120个并发流(Whisper仅14个)。模型支持5档可调chunk大小(80-1120ms),内置标点和大写功能,多语言切换表现优异。但中文识别(TierB)

文章图片
#开源#语音识别#人工智能
    共 229 条
  • 1
  • 2
  • 3
  • 23
  • 请选择