logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

李飞飞团队新作:无需修改架构,重组数据即显著提升AI对视频理解能力

一种简单得令人惊讶的方法,只需将现有的短视频素材重组,就能在不增加计算成本的前提下显著提升AI对长视频的理解能力。斯坦福大学、微软研究院和威斯康辛大学团队,提出了VideoWeave数据中心化方法。不需要发明新的复杂架构,也不需要耗资巨大的新标注,仅仅通过改变喂给模型的数据组织形式,就能让AI变得更聪明。训练视频语言模型一直是个烧钱的苦差事。相比于静态图像,视频多了一个时间维度,处理一秒钟的视频往

#人工智能#音视频#深度学习
Black Forest Labs发布Flux 3!初评超过Seedance 2.0,将开源

曾经的开源图像模型王者 Black Forest Labs(黑森林实验室)刚刚发布了 FLUX 3。FLUX 3不再是图像模型,已经进化成把视频、音频、动作预测全塞进了同一个模型里的多模态模型。它将多模态流模型作为视觉智能的基石,开始同时用眼睛、耳朵和触觉去理解世界。Black Forest Labs 成立于2024年,核心创始人是三位曾在Stability AI共同开发了知名开源图像生成模型 S

#音视频
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画

大家每天滑手机和看网页,常会看到流畅的动画,其中很多是矢量动画。现在,输入几句大白话或一张图,机器就能直接生成这种轻巧的动画。复旦大学,阶跃星辰,香港大学多模态实验室与昆士兰大学的联合团队推出了OmniLottie框架。OmniLottie利用创新的分词技术,把视频、图文指令直接变成了高质量的矢量动画。团队设计了专门的代码压缩方法,整理了200万规模的数据集,让系统能听懂文字,看懂图像、视频频,直

#人工智能
Flux 2开源即结束:阿里通义Z-Image用6B参数,实现超高性能和生图速度,荣登开源榜首

开源还得看国产!图像生成社区期待已久的 Flux 2,刚刚开源一天,即被阿里通义实验室开源的 Z-Image 精准狙击。Flux 2 以其 32B 参数,超高显存要求以及超慢的生成速度,已经将社区的大部分开发者拒之门外。对国内开发者来说,中文支持表现不佳,也是硬伤。而这一切,都被 6B 参数 S3-DiT 架构模型的 Z-Image,以 8 步采样实现亚秒级出图并完美适配 16GB 消费级显卡完美

#人工智能
万字硬核解读SAM 3:不止分割一切,它开始理解世界了

Meta最新的SAM 3,让分割模型学会了理解你说的话,而不仅仅是你指的东西。计算机视觉里的Segment Anything Model (SAM,分割一切模型) 系列,一直在干一件事,就是把图像视频里你想要的东西给“抠”出来。2023年的老大SAM 1,像个刚学会指认东西的婴儿。你给它一张图,用鼠标点一下、画个框,它就把那个东西的轮廓给你描出来。它开创了一个时代,让模型学会了零样本泛化,不用提前

文章图片
#语言模型
北大团队重磅研究登Nature!新型芯片算力超顶级GPU 1000倍,能效提升100倍

北京大学集成电路学院孙仲教授联合黄如院士、蔡一茂教授和王宗巍助理研究员,提出了一种高精度、可扩展的模拟矩阵方程求解方案。研究显示,该方案在信号检测任务中仅需三次迭代即可达到FP32级别性能,吞吐率可提升1000倍,能效提升100倍,为未来类脑模拟计算与6G通信处理器开辟了全新路线。该研究10月13日登上国际顶级期刊《Nature Electronics》。

文章图片
#人工智能
万字长文 | 异构算力技术架构与核心组件解析

训练过程中的数据加载、参数交换、梯度同步等操作都需要高存储带宽支持。将数据读取、数据预处理计算、以及芯片上的模型计算三个步骤异步并行执行。影响算力利用率的因素包括算法特性、数据依赖性、内存带宽限制等。数据预处理与加载的优化需要综合考虑数据特性、硬件配置、训练框架等多个因素。主要厂商包括寒武纪、华为昇腾、海光、壁仞、燧原、沐曦、摩尔线程等。需要硬件、网络、软件、算法等多层面的协同优化。数据访问模式、

文章图片
#架构#fpga开发
高通收购开源硬件鼻祖Arduino,布局端侧芯片+硬件的下一代AI物联网生态

手机芯片巨头高通(Qualcomm),把开源硬件鼻祖Arduino给买了。10月7日,两家公司联合宣布了这笔收购。Arduino将作为高通的独立子公司,总部还留在意大利继续运营。一个是靠通信技术起家,把持着全球移动芯片市场的巨头。高通Qualcomm,拆开来就是“高质量通信”(QUALity COMMunications)。从1985年几个工程师在车库里捣鼓出码分多址(CDMA)技术开始,这家公司

文章图片
#开源#人工智能#物联网
解放双手?Mobile-Agent-v3多模态GUI智能体实现跨平台自动化突破!

从数据可以看出,GUI-Owl与Mobile-Agent-v3在多项指标上实现了显著提升:AndroidWorld得分达到73.3,OSWorld得分达到37.7,在多模态理解能力方面甚至超越了GPT-4o与Claude 3.7等闭源竞品。其核心目标非常明确:通过多模态大模型与智能体框架的结合,打破传统GUI自动化的技术瓶颈,实现真正通用、鲁棒、跨平台的智能操作能力。从单设备自动化到全平台智能生态

文章图片
#自动化#运维
放弃微调,斯坦福联合发布智能体上下文工程(ACE),模型性能提高10%,token成本降低83%

斯坦福、桑巴诺瓦系统公司(SambaNova Systems)和伯克利联手搞了个新框架,叫“智能体上下文工程”(Agentic Context Engineering, ACE),让模型像人一样,通过复盘和迭代来自我进化。关键是,这个过程不动模型权重,成本还暴降。看看这性能提升:这事儿挺颠覆的。

文章图片
#sqlite
    共 996 条
  • 1
  • 2
  • 3
  • 100
  • 请选择