logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

国产GPU配类脑芯片,推理成本砍掉四成,这条“异构“路值得细看

我个人的感受是,推理成本的账要重新算一遍。一旦异构推理这套东西真跑进生产环境,单位token的成本曲线会被压得比想象中平,那些"算不过来账"的应用——比如低毛利的对话、免费层的多轮问答——就重新有了活路。上周在廊坊的2026中国算力大会上,移动云联合南湖研究院、灵汐科技、天数智芯还有清华北大,发了一套东西,名字挺长,叫"国产GPU+类脑芯片大模型异构混合推理系统"。我比较好奇的是,这套"GPU+专

#人工智能
MiniMax H3开源即登顶、字节连发三款模型:多模态AI正在经历“统一战争

这波"统一"浪潮来得如此集中,不是偶然的市场炒作,而是三条技术线索同时到达临界点的结果。线索一:MoE架构让"大而全"变得可行。统一的代价是模型参数量的膨胀。一个纯文本模型只需要处理离散的token,但一个多模态模型需要同时处理图像patch、视频帧、音频波形,数据维度是文本的几百倍。Sand.ai发布的全球首个千亿级MoE视频模型,证明了MoE的路由机制可以有效地把计算资源分配给最需要的那部分模

#人工智能
AI Agent 宁愿相信过期记忆,也不信实时数据——新基准测试戳破了一个残酷真相

上周我在调试一个客服 Agent,发现一个让我后背发凉的事情。用户已经改了收货地址,Agent 也调了 API 确认了新地址。但到了发货环节,它还是把包裹寄到了旧地址。我查了半天日志,发现 Agent 的短期记忆里存着用户三个月前说的"我的地址是XXX",API 返回的新地址它看见了,但没采用。这不是 bug。这是 Agent 记忆系统的设计缺陷——而且它比我想象的普遍得多。

#人工智能
84% 在用,只有 29% 敢信——AI 编程工具的信任悖论

上周有个场景让我印象特别深。组里一个刚毕业的同事,用 Cursor 写了 200 行 Python,跑起来了,没报错,高高兴兴提了 PR。我 review 的时候发现一个遍历逻辑里有个 off-by-one——不是他写错了,是 AI 生成的代码在边界条件上偏了一位。问题不大,但如果在生产环境跑,某个用户的数据会一直算不对。他说了句话让我想了很久:"我看它跑通了就觉得没问题啊。这不能怪他。2026

#人工智能
84% 在用,只有 29% 敢信——AI 编程工具的信任悖论

上周有个场景让我印象特别深。组里一个刚毕业的同事,用 Cursor 写了 200 行 Python,跑起来了,没报错,高高兴兴提了 PR。我 review 的时候发现一个遍历逻辑里有个 off-by-one——不是他写错了,是 AI 生成的代码在边界条件上偏了一位。问题不大,但如果在生产环境跑,某个用户的数据会一直算不对。他说了句话让我想了很久:"我看它跑通了就觉得没问题啊。这不能怪他。2026

#人工智能
GPT-6 Astra 发布当天,ChatGPT、Claude、Grok 一起崩了三个多小时

今天 AI 圈发生了两件事,单拎出来每一件都是头条,但放在同一天,就显得特别讽刺。第一件:凌晨,OpenAI 正式发布 GPT-6 Astra,总裁 Greg Brockman 在发布会上宣布"欢迎来到 AGI 时代"。第二件:就在前一天,ChatGPT、Claude、Grok 三家同时宕机,持续近 4 个小时,连带着 Cursor 也瘫痪了。一边是"AGI 来了"的宏大叙事,一边是连基础服务都保

#人工智能
我的 FDE 日常被 AI Agent 颠覆了——从半天到 10 分钟

我第一次让它跑的时候,它生成的检查脚本里有个逻辑漏洞——它假设所有节点的配置是一样的,但实际上那个集群有三台机器的内核版本不同。你需要的不是"听话照做",而是"我知道它在做什么,所以我能判断它做得对不对"。而且它的分析路径比我更系统——我不是没想到 DNS,我是被"网络策略"这个方向带偏了,先入为主了。我把报错信息和集群配置扔给了一个 Agent 工作流,它花了大概 30 秒分析完,直接告诉我:"

#人工智能
从 DeepSeek 涨价看大模型定价逻辑的变迁

大模型定价从"补贴换市场"到"价值定价"再到"分层定价",本质上是行业在走向成熟。我的看法是——三者都有,但最值得聊的不是价格本身,而是**定价逻辑正在发生的变化**。社交软件的网络效应是"用户越多越好用",而大模型是"用户越多,算力成本越高"。就是**能力更强的模型,定价更高**。2. **做好模型路由**:简单任务用便宜模型,复杂任务用贵模型,整体成本最优。1. **别只看价格,看性价比**:

#人工智能
中国大模型包揽全球调用量前五,DeepSeek-V4-Flash 正式版环比增长 570%

OpenRouter 这张榜单说的事其实很简单:开发者用 Token 投了票,而且票数还在涨。但问题也来了——当国产模型从"便宜货"变成"首选",下一阶段拼什么?是拼参数规模,还是拼生态,还是拼落地场景?我自己的想法不太一样。我觉得真正决定胜负的,是"谁能帮开发者赚到钱"。模型跑得再快,如果上层应用跑不通商业模式,都是白搭。DeepSeek 涨价之后,开发者会不会回流 GPT?腾讯会不会跟进降价?

#人工智能
同一个模型,两张榜单差了 15 分:大模型评测到底还能信谁

所以今年业内已经在往"原创、长周期、真实 Agent 工作流"的方向转,比如 7 月发布的 DeepSWE——113 个原创长周期软件工程任务,跨 91 个活跃开源仓、5 种语言,用人工编写的验证器判分。你说这是"更科学的修正"还是"为了榜单自洽做的回归",见仁见智。这类事件多了以后,榜单在你心里就成了"某个组织想让你看到的排名",而不是"模型真实能力的客观投影"。我现在更愿意把榜单读成"证据"而

#人工智能
    共 34 条
  • 1
  • 2
  • 3
  • 4
  • 请选择