
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
一种简单得令人惊讶的方法,只需将现有的短视频素材重组,就能在不增加计算成本的前提下显著提升AI对长视频的理解能力。斯坦福大学、微软研究院和威斯康辛大学团队,提出了VideoWeave数据中心化方法。不需要发明新的复杂架构,也不需要耗资巨大的新标注,仅仅通过改变喂给模型的数据组织形式,就能让AI变得更聪明。训练视频语言模型一直是个烧钱的苦差事。相比于静态图像,视频多了一个时间维度,处理一秒钟的视频往
曾经的开源图像模型王者 Black Forest Labs(黑森林实验室)刚刚发布了 FLUX 3。FLUX 3不再是图像模型,已经进化成把视频、音频、动作预测全塞进了同一个模型里的多模态模型。它将多模态流模型作为视觉智能的基石,开始同时用眼睛、耳朵和触觉去理解世界。Black Forest Labs 成立于2024年,核心创始人是三位曾在Stability AI共同开发了知名开源图像生成模型 S
大家每天滑手机和看网页,常会看到流畅的动画,其中很多是矢量动画。现在,输入几句大白话或一张图,机器就能直接生成这种轻巧的动画。复旦大学,阶跃星辰,香港大学多模态实验室与昆士兰大学的联合团队推出了OmniLottie框架。OmniLottie利用创新的分词技术,把视频、图文指令直接变成了高质量的矢量动画。团队设计了专门的代码压缩方法,整理了200万规模的数据集,让系统能听懂文字,看懂图像、视频频,直
开源还得看国产!图像生成社区期待已久的 Flux 2,刚刚开源一天,即被阿里通义实验室开源的 Z-Image 精准狙击。Flux 2 以其 32B 参数,超高显存要求以及超慢的生成速度,已经将社区的大部分开发者拒之门外。对国内开发者来说,中文支持表现不佳,也是硬伤。而这一切,都被 6B 参数 S3-DiT 架构模型的 Z-Image,以 8 步采样实现亚秒级出图并完美适配 16GB 消费级显卡完美
Meta最新的SAM 3,让分割模型学会了理解你说的话,而不仅仅是你指的东西。计算机视觉里的Segment Anything Model (SAM,分割一切模型) 系列,一直在干一件事,就是把图像视频里你想要的东西给“抠”出来。2023年的老大SAM 1,像个刚学会指认东西的婴儿。你给它一张图,用鼠标点一下、画个框,它就把那个东西的轮廓给你描出来。它开创了一个时代,让模型学会了零样本泛化,不用提前

北京大学集成电路学院孙仲教授联合黄如院士、蔡一茂教授和王宗巍助理研究员,提出了一种高精度、可扩展的模拟矩阵方程求解方案。研究显示,该方案在信号检测任务中仅需三次迭代即可达到FP32级别性能,吞吐率可提升1000倍,能效提升100倍,为未来类脑模拟计算与6G通信处理器开辟了全新路线。该研究10月13日登上国际顶级期刊《Nature Electronics》。

训练过程中的数据加载、参数交换、梯度同步等操作都需要高存储带宽支持。将数据读取、数据预处理计算、以及芯片上的模型计算三个步骤异步并行执行。影响算力利用率的因素包括算法特性、数据依赖性、内存带宽限制等。数据预处理与加载的优化需要综合考虑数据特性、硬件配置、训练框架等多个因素。主要厂商包括寒武纪、华为昇腾、海光、壁仞、燧原、沐曦、摩尔线程等。需要硬件、网络、软件、算法等多层面的协同优化。数据访问模式、

手机芯片巨头高通(Qualcomm),把开源硬件鼻祖Arduino给买了。10月7日,两家公司联合宣布了这笔收购。Arduino将作为高通的独立子公司,总部还留在意大利继续运营。一个是靠通信技术起家,把持着全球移动芯片市场的巨头。高通Qualcomm,拆开来就是“高质量通信”(QUALity COMMunications)。从1985年几个工程师在车库里捣鼓出码分多址(CDMA)技术开始,这家公司

从数据可以看出,GUI-Owl与Mobile-Agent-v3在多项指标上实现了显著提升:AndroidWorld得分达到73.3,OSWorld得分达到37.7,在多模态理解能力方面甚至超越了GPT-4o与Claude 3.7等闭源竞品。其核心目标非常明确:通过多模态大模型与智能体框架的结合,打破传统GUI自动化的技术瓶颈,实现真正通用、鲁棒、跨平台的智能操作能力。从单设备自动化到全平台智能生态

斯坦福、桑巴诺瓦系统公司(SambaNova Systems)和伯克利联手搞了个新框架,叫“智能体上下文工程”(Agentic Context Engineering, ACE),让模型像人一样,通过复盘和迭代来自我进化。关键是,这个过程不动模型权重,成本还暴降。看看这性能提升:这事儿挺颠覆的。








