
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
MatrixOrigin 张祖羽博士的 VLDB 2026 现场见闻:时隔 51 年重返波士顿的特别回顾、Reynold Xin 与周靖人的两场 Keynote、Agent 时代的数据系统趋势与 GPU 数据库的兴起,以及 ContextPipe 获得 ADS 2026 Oral Paper Award。

近年来,大模型(LLMs)的热潮推动了自然语言处理(NLP)任务的广泛进展,NL2SQL(自然语言转SQL)作为热门任务之一也不例外。但是普遍的这些模型的参数量都在100B以上,而NL2SQL作为一个相对niche的场景,并且和业务场景结合密切的情况下,是否可以在一些小参数量的模型上也获得比较好的表现呢?效果立竿见影,准确率从 0.44 → 0.81,说明大模型“理解错误”更多是输入结构的问题。这

矩阵起源的一个思路是使用 RAG 模式或者使用大模型给出直接答案的时候,对输入和输出进行评估,如果需要精确实时信息而大模型自身又无法判断的时候,我们就会重定向到知识图谱或是结构化数据库中寻找精准的答案,即一个能实现大模型诊断的数据管理系统。这需要企业客户以及厂商对大模型的价值边界和局限性,以及自身的应用场景有较为清晰的认知,做好落地准备和执行,同时也要意识到企业的管理和运营策略也需要做相应的变化,

生成式AI(GenAI)应用面临超80%项目无法落地的困境,核心瓶颈在于数据碎片化问题已升级为多模态数据割裂。传统解决方案难奏效,需构建统一数据智能底座。《面向GenAI的数据智能底座》白皮书提出系统性方案,涵盖问题分析、实施路线图和技术架构解析,帮助企业实现数据从"绊脚石"到"燃料库"的转变。矩阵起源与InfoQ联合发布的这份报告,为AI应用落地提供了突破

Git4Data 系列(八),AI 训练实践篇开篇:先建立机器学习全流程的坐标系。从数据接入、质量门禁、清洗标注、特征工程、训练/验证/测试集发布、模型评估,到上线监控与反馈重训,逐环节说明 snapshot、branch、diff、merge、cherry-pick、restore 与 PITR 能解决什么、不能解决什么,并以一个持续迭代的风控模型完整串联。配套脚本在 MatrixOne 4.1

Git4Data 系列(十),深度学习篇:文件型(图像等)训练数据分成两个世界——图/音/视频文件交给 lakeFS,指针/标签/哈希/切分组成的元数据交给 MatrixOne。以训练一个图像分类模型为例,用 SQL 在元数据上完成接入(WAP)、精确+感知去重、评测去污染、完整性检查、重标注、data curation 发布,并用「元数据快照 × lakeFS commit」钉成可复现训练集;l

Git4Data 系列(十一),大模型篇:SFT 的数据量比预训练小好几个数量级,每一次取舍都印在模型行为上。本文用一个对话模型的 SFT 数据池,在零拷贝分支上完整走一遍 curation——精确去重、近重复、质量门、安全、评测去污染、多轮对话完整性六步过滤,每步先计数,DATA BRANCH DIFF 给出这一轮的净变更,再按先登记、后替换、再快照的顺序发布;并对比业内其他做法。SQL 在 M

Git4Data 系列(十二),大模型篇:偏好数据的单位不是行而是对,而且不是采集来的、是从标注投票算出来的二阶数据——RLHF 与 DPO 两条路线共用同一份。本文用 20000 个 prompt 的偏好池,从 63000 条投票推导偏好对,在分支上审计退化对、无共识、偏好环与长度偏置,DIFF 出这一轮的净变更,用分支裁决标注分歧、合并前先把冲突清单物化下来,最后先登记后快照把数据集与奖励模型

MatrixOrigin 分享从 FDE 到 Forward Deployed Builder(FDB)的组织实践,并探讨 AI 如何放大个人能力、推动 Builder 成为嵌入组织的 OPC。文章进一步提出,AI 原生组织应成为 Builder、项目与新业务的虚拟孵化器。

AI助手崩溃或切换时的"临终备忘录"机制 针对AI助手在崩溃、上下文窗口过载或模型切换时丢失工作记忆的问题,本文提出创新的"临终备忘录"解决方案。该机制在AI检测到即将"死亡"(重启/压缩/切换)时,自动记录当前任务进度、配置和下一步计划,存储于共享路径中。新启动的AI会优先读取备忘录,实现无缝衔接。 备忘录包含: 身份信息和项目背景 当








