logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器人GPT时刻!英伟达WAM赋予全机器人零样本操作能力

英伟达刚刚发布的首个世界动作模型(World Action Model,WAM) DreamZero 让机器人拥有了通过视觉预测未来并指导动作的物理直觉。这款拥有 14B 参数的世界动作模型,通过将视频生成与动作预测深度耦合,让机器人即便在从未见过的环境中,也能凭借对物理规律的理解完成从未训练过的复杂任务。

文章图片
#音视频
Game over!视频GPT-4o时刻!字节Seedance 2.0引爆全球

它支持同时输入文本、图像(最多 9 张)、视频(最多 3 段,总时长 ≤15 秒)、音频(最多 3 段,总时长 ≤15 秒),总计最多 12 个资产作为参考,一键生成 1080p 甚至更高分辨率的影视级视频,带原生对话、音效、音乐和唇音同步。Seedance 系列,此前 1.0/1.5 版本已在多镜头叙事、语义理解和提示遵循上表现出色,而 2.0 版实现了质的飞跃,被内部称为真正可控的多模态AI视

#音视频#人工智能#百度
阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合

一直以来,开源最强图像生成和图像编辑,一直是阿里通义万象的 Qwen-Image 和 Qwen-Image-Edit。它们一直是分开的,现在终于合体了。这是Qwen-Image-2.0生成的,自己的发展历程时间轴PPT。模型不仅准确梳理了两条时间线,还准确渲染了每一个关键节点的文字说明。更有趣的是画面中的细节控制。注意图中的“画中画”:小狗和人物,都保持了相同的样子。这种在同一画面中保持主体一致性

#人工智能
阿里Qwen3.5发布:仅17B激活的高效率、高性能原生多模态

开年第一篇文章献给“源神”阿里!阿里除夕发布了拥有 397B 参数的视觉语言模型,单次推理仅激活 17B 参数,性能直接比肩万亿规模的前沿大模型。这款名为 Qwen3.5-397B-A17B 的开源权重模型打破了视觉与语言的隔离,通过底层混合架构与异步强化学习框架实现了效率与泛化能力的跨越。

#语言模型#人工智能
紧追顶级闭源,最强开源GLM-5是怎样炼成的?

智谱GLM-5技术报告正式发布。当前,顶级模型如Claude Opus 4.6等,已经成功将编程范式从单纯的代码生成推向了由AI自主规划与执行的智能体工程新时代。GLM-5作为开源模型中首个实现此目标的大模型,与闭源模型差距极小,而且紧追不舍。最强开源GLM-5是怎样炼成的?7440亿参数规模的GLM-5,引入了DeepSeek稀疏注意力机制(DeepSeek Sparse Attention,

#开源
30B模型搞科研,超越GPT-5.4,性能从1.7%提升到33.3%

UniPat AI联合北京大学,基于Qwen3-30B-A3B-Thinking-2507研发了一款专门搞前沿科学研究的模型UniScientist。在前沿科学研究基准测试(FrontierScience-Research)中达到33.3%,超越了刚刚发布的顶级模型GPT-5.4(33.0%)。这一切都源于研发团队深度打造了一个数据集。原Qwen3-30B-A3B-Thinking-2507直接跑

#人工智能#机器学习
Skill制作和使用秘诀!Claude Code工程师的官方宝藏经验

如果你对 Skill 还很陌生,建议你阅读官方文档,或者观看 Skilljar 上关于 Agent Skill 的最新课程。本文将假设你已经对 Skill 有了一定的了解。官方文档:https://code.claude.com/docs/en/skillsAgent Skill 最新课程:https://anthropic.skilljar.com/introduction-to-agent-s

#人工智能
DeepSeek-R1之后是智能体式思考:林俊旸离职后首发长文

大模型发展轨迹正在迎来转折。过去两年里,大语言模型从单纯的文字接龙,进化到了能够像人类一样深思熟虑的DeepSeek-R1推理式思考。无数开发者与研究人员为之振奋。而拉开下半场帷幕的关键,已经悄然转向了看谁能在复杂的真实世界中干得更漂亮。阿里通义千问前技术负责人林俊旸在离职后首次公开发声,深度复盘了行业过往的路线探索。林俊旸点明下了一代人工智能的核心将全面迈向智能体式思考,一个从训练孤立模型到构建

#人工智能
火速!Claude Code泄露事件自救方案来了

现有的SAST(静态应用安全测试)工具只擅长捕捉代码逻辑里的漏洞,对打包配置和最终产物往往视而不见。专门扫描密钥的工具虽然能查出硬编码的密码,却无法推测出最终发布的安装包里到底包含哪些文件。检查外部依赖的工具只关注已知漏洞库,并不翻看安装包的真实内容。在大家都不看代码甚至连配置文件都不去审查的时代,必须要有全新的工具守住底线。研究人员为此设计了VibeGuard框架。它精准卡在代码构建完成之后且最

#人工智能
和DeepSeek拼了!Meta发新模型,Opus 5的性能,几乎免费

DeepSeek V4 Flash凭借击穿地板的定价策略,对全球AI圈产生了极具破坏性的鲶鱼效应,实质上点燃了新一轮的行业价格战。相比美国同类主流产品,其价格优势最高可达97%。即使OpenAI对GPT-5.6 Luna进行了大幅降价,V4 Flash的单任务成本依然比其低约60%(刚刚ChatGPT免费默认模型换成了5.6 Luna)。Meta发布了编程增强模型Muse Spark 1.2,性能

#深度学习
    共 901 条
  • 1
  • 2
  • 3
  • 91
  • 请选择