DeepSeek V4 Flash 0731 开源,登顶开源模型前三

前两天大清早,我刚揉着惺忪的睡眼打开手机,刷推特的时候突然看到 Artificial Analysis 弹了一条推送。

当时我整个人直接就愣住了。

DeepSeek 又搞事情了。

它们悄无声息地开源了全新的 DeepSeek V4 Flash 0731。

这玩意儿在 Artificial Analysis 智能指数上直接考出了 50 分的高分,瞬间杀进全球开源模型的前三名。

更离谱的是什么呢,它采用的是完全自由的 MIT 许可,总参数 284B,但实际激活参数居然只有 13B,FP4/FP8 混合精度跑下来大概也就 167GB 左右。

而且架构和定价完全跟之前的 V4 Flash 保持一致,官方 API 也已经在第一时间内上线了。

说实话,看到这个消息的时候,我脑子里第一反应不是什么技术突破,而是脑补了一幅特别骚的画面。

你在硅谷那些高大上的写字楼里,几百个顶尖科学家开着百万年薪,烧着几亿美金的算力,天天加班加点搞模型蒸馏、调参、架构优化。

结果远在杭州的几个年轻人,喝着茶,顺手把代码和权重往 GitHub 上一扔。

然后跟全世界说,来,开源的,拿去玩吧,性能还跟我们之前收费的昂贵 API 一模一样。

这尼玛简直就是对当前整个硅谷 AI 圈子的一场无声嘲讽。

我当时就忍不住寻思,DeepSeek 这帮人到底是用什么材料做的,怎么能做到每次发新东西都像是在玩降维打击。

为了彻底搞明白这玩意儿到底是真牛逼还是纯粹在吹牛,我当天就直接调用了官方刚刚上线的 API,顺便在 Hacker News 和推特上扒了一整天国外大佬们的评测和源代码讨论。

今天我就想跟大家好好聊聊这个刚出炉的 DeepSeek V4 Flash 0731,以及这背后隐藏着的一些极其有意思、甚至有点背离直觉的技术秘密。

一、13B 激活参数的性能奇迹

故事得从 Artificial Analysis 那个榜单开始说起。

很多人可能对 Artificial Analysis 这个机构不太了解,你可以把它理解成 AI 界非常权威的第三方裁判所。

它们不看你厂商宣传页上写的那些花里胡哨的指标,只用自己的一套基准测试去硬测模型的真实能力、推理速度和性价比。

这次 V4 Flash 0731 跑出来的 50 分是什么概念呢,就是在所有开源大模型里,它已经能够稳稳地跟顶级的开源巨无霸们平起平坐了。

但你要知道,通常那些能考到这个分数的开源模型,动不动就是几百 GB 甚至是上 TB 的体量,想要在本地或者私有云上跑起来,你没个几张 A100/H100 显卡连看都不敢看。

而 DeepSeek 这个 Flash 版本,总参数虽然达到了 284B,但在实际计算推理的时候,依靠极度骚气的 Mixture of Experts 架构,真正激活的参数只有 13B。

13B 啊朋友们。

13B 意味着什么,意味着它的计算开销和响应速度其实跟一个轻量级的端侧模型差不多。

你用着 13B 参数的算力成本,拿到了媲美巨型模型的推理能力。

这种感觉就像是你花了一辆飞度车的油钱,结果油门踩下去直接推出了保时捷 911 的加速度。

而且这次它们还把模型用 FP4 和 FP8 的混合精度给压缩到了 167GB 左右。

虽然 167GB 显存对于个人电脑来说依然有点吃力,但对于绝大多数企业级服务器或者多卡消费级显卡组合来说,部署门槛简直是被直接一脚踹翻到了地狱门槛。

更绝的是,DeepSeek 依然直接给了 MIT 许可。

熟悉开源协议的朋友都知道,MIT 协议基本上就是相当于告诉你,拿去用吧,拿去改吧,你想拿去商业化卖钱都无所谓,别找我麻烦就行。

在这个很多大厂都在搞伪开源、给开源协议加各种商业限制条款的年代,DeepSeek 这种直接丢 MIT 协议的做法,真就叫真诚是唯一的捷径。

二、打不过就加入的受控实验

说到这里,我就不得不提起前两天在 Hacker News 上看到的一个超级热门的帖子。

那个帖子名字叫 Show HN: 将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制。

这个帖子是由 CTGT 团队发出来的一篇研究报告,他们在 Hacker News 上一挂出来就直接被顶上了首页。

研究内容特别骚,可以说是精准地戳中了西方科技圈一直以来最敏感、也最纠结的一个痛点。

大家也都知道,国外很多开发者和机构对中国背景的 AI 模型一直有一种说不清道道不的戒心,总觉得中国的模型带有某种天然的审查机制。

于是这个 CTGT 团队就做了一个非常有意思的受控实验。

他们用 DeepSeek V4 Flash 作为教师模型,去蒸馏训练美国本土的开源模型 GPT-OSS-120B。

说白了,就是让美国的开源模型去天天背诵、学习 DeepSeek 的输出内容,看看能不能把 DeepSeek 身上强大的推理能力给学过来。

同时,他们最核心想观察的一点是,在把 DeepSeek 的能力蒸馏过去的过程中,那些所谓的审查行为,到底会不会跟着一起迁移到美国模型身上。

实验结果出来之后,所有的研究人员都傻眼了。

不仅没有出现他们担心的审查迁移,相反,GPT-OSS-120B 在吸收了 DeepSeek V4 Flash 的输出之后,金融推理能力和复杂逻辑能力出现了暴涨。

这说明了什么,说明 DeepSeek 模型的底层推理能力和逻辑框架,跟表面上的安全过滤机制完全是两码事。

模型的智慧是纯粹的逻辑和知识,而所谓的过滤层只是外面套的一层壳。

当西方开发者拿到了 DeepSeek 的开源权重或者 API 输出来训练自己的模型时,他们得到的全是硬核的数学、代码和金融推理干货。

看到这个实验结果的时候,我真的差点笑出声。

这不就是典型的打不过就加入吗。

嘴上说着不要,身体却非常诚实地拿 DeepSeek 的数据去喂自己的模型,结果喂完发现效果好得不行。

这也印证了我一直以来的一观:技术本身是没有国界的,真正能够打动人类的,永远是绝对硬核的实力和效率。

三、真实调测与极速响应体感

说实话,我自己也在项目里试着调用了新版 V4 Flash 的 API。

我随便扔给了它一段极其繁琐的 Java 后端并发代码,里面包含了复杂的 Redis 缓存击穿逻辑和 Lua 脚本原子更新。

这种代码如果让一般的模型来看,很可能会在上下文解析或者逻辑推演上出现纰漏。

但 V4 Flash 0731 的返回速度快得飞起,并且不仅精准指出了我代码里关于锁释放的一个隐蔽 Bug,还顺手给我优化出了一版性能更高的实现。

那种毫秒级响应带来的爽快感,真的会让你觉得科技的进步太特么赤鸡了。

你可以回想一下,在两三年以前,我们想要用上这种级别的模型能力,需要经历怎样的过程。

你需要按月支付高昂的订阅费,你需要忍受时不时的网络卡顿,你需要看着那个光标像乌龟爬一样一个字一个字地往外吐。

而现在,DeepSeek 把这一切都给打下来了。

它们不仅把 API 价格压到了极致,还把最核心的开源权重毫无保留地拱手相让。

四、技术浪漫主义与大时代

我有时候觉得,DeepSeek 正在用一己之力重塑整个全球 AI 的生态格局。

它们不是在跟 Open AI 或者 Anthropic 竞争某一款产品的市场份额,它们是在用一种接近于公用事业的方式,把顶尖 AI 算力和推理能力的获取成本,推向无限接近于零。

当技术被折叠到人人都可以轻易触及的高度时,奇迹才会真正发生。

你不再需要是一个拥有千万融资的创业公司,你甚至不需要有一间像样的办公室。

你只需要一台带显卡的电脑,加上一点点对这个世界的好奇心,你就可以基于 DeepSeek 开源的模型,搭建出属于你自己的超级应用。

从最早的 DeepSeek V1 到现在的 V4 Flash 0731,我一路看着它们走过来,最感动我的从来不是那些跑分榜单上的数字。

而是这群人身上那种极具硬核工匠精神的浪漫主义。

它们不搞花里律哨的发布会,不讲那些动不动就要改变人类命运的宏大叙事。

它们只是默默地在每一个节点上,把代码写好,把架构调优,把权重打包,然后发个推特说,呐,我们做出来了,表现还不错,开源了,大家拿去玩吧。

这才是真正的技术精神。

坦率的讲,在这个充满了喧嚣、泡沫和焦虑的时代,能看到有这样一家团队,始终践行着对技术的好奇与真诚,真的让人非常庆幸。

大时代啊,朋友们。

当顶尖的模型能力像空气和水一样变得触手可及,接下来最重要的,就是看我们这些普通人,能用它来玩出什么有意思的花样了。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,我们,下次再见。

/ 作者:Ea4on

更多推荐