
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
MCP和A2A之后,机器人网络里还缺一层开放通信协议
CoALA的记忆框架在数字世界成型之后,具身智能还缺哪几层
VLA落地的三条路径:端到端、结构化技能库与混合架构
数字世界经历了大致五个阶段:L1 是每个人有可用的模型调用能力,L2 是每个人用 Agent 开展工作、旧工具也能被 Agent 调用,L3 是人和 Agent 共享结构化的语义记忆,L4 是生产力之间形成协作网络、持续做评测优化,L5 是企业积累出独有的数据和能力,和具体基础模型解耦。中间有一处需要打通,具身领域讲的"本体"通常是物理结构,语义记忆里的"本体"是概念和关系的抽象,两种本体未来需要
今年具身智能的技术叙事,几乎全部压在同一层:VLA、端到端、抓取成功率、轨迹泛化。视觉模型看得准不准,动作模型抓得稳不稳,论文和demo都在回答一个问题——单台机器人"自己"够不够聪明。但有一个问题被系统性地忽略了:一台机器人足够聪明之后,它怎么和另一台机器人、和企业里跑了十年的排班系统、和后台那群数字Agent一起干活?这篇想把第二个大脑单独拎出来讲:它的技术定义是什么、为什么VLA scale
在Mac上跑大模型,MLX 不是终点

随着RTX Spark等高性能端侧设备的出现,AI行业正在从追求单一通用大模型的"Scaling Up"转向分布式小模型协作的"Scaling Out"模式。研究表明,4B-8B参数的专精小模型在特定任务上已能媲美大模型,结合开源工具链(如Mano-P)和芯片优化(如NVIDIA/苹果方案),端侧多模型协作展现出显著成本优势:以开发场景为例,本地方案首年可节省数千美元API费用,同时保障数据隐私。

大语言模型能回答的问题越来越多,但只要你追问一句信息来源是什么,很多回答就开始经不起推敲了。RAG 是解决幻觉最主流的工程方案。

K3 还从零构建了一个叫 MiniTriton 的类 Triton 编译器,自己的 IR 层跑在 MLIR 上,有优化 pass 和 PTX 代码生成流水线,部分负载性能超过 Triton 和 torch.compile,能跑通完整的 nanoGPT 训练并稳定收敛。两个方向都在快速推进,服务的场景其实不一样,不构成直接竞争。过去一年,开源模型的参数上限一直在被刷新,Llama 3 是 405B,
MMLU 覆盖57个学科的选择题,从高中数学到法学到医学都有,它确实能反映一个模型的知识广度和选择题作答能力,但它不测长文本连贯性,不测多轮对话里的上下文保持,不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链,chain-of-thought 能力强的模型在这两个榜上分数好看,可真实工作中遇到的数学问题从来不是"小明有三个苹果"那样条件清晰的格式,条件是模糊的、信息







