
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
数字孪生很火,自己却不以为然,因为一方面觉得数据工作者干的活跟数字孪生差不多,不就是业务数据化和数据业务化吗?二是别人来谈数字孪生的时候,除了3D建模就讲不出实质性的东西了,自己就在想,这...
你是一个数据运维专家。请识别出其中所有定义模糊(例如,‘活跃’的定义)、存在歧义或缺少关键信息(例如统计周期、是否包含测试用户等)的地方,并以提问的方式,列出一个问题清单,方便我向业务方进行二次确认。在清洗数据时,模型可能会过度解读或错误关联,将正确的数据“清洗”成错误的数据(例如,错误地标准化一个罕见但正确的公司名称,或者在提取信息时张冠李戴)。这种“帮倒忙”的行为对数据质量是致命的。请按照['
这家Spark起家的公司市值超过了1000亿美金,其在某种程度上代表了数仓的未来。我们要理解它,学习它,超越它!公众号推送规则变了,如果您想及时收到推送,麻烦右下角点个。GenAI:收购 MosaicML (2023)性能怪兽:Photon 引擎 (2021)Spark 革命与公司诞生 (2013)Delta Lake 诞生 (2019)缘起:伯克利Lab (2009)传统数仓死了,新的继承者当立
真正的分析能力,是你能不能透过数据看到业务的真相,能不能用数据讲出一个让人信服(且让自己安全)的故事,以及——最重要的——你能不能在复杂的博弈环境中,推动事情往正确的方向走,并且让自己活下来。然后在复盘会上,当产品团队提出优化方案时,老赵再站出来,用数据去支持这个方案:“我们分析了,如果推出‘经典模式’,根据用户画像推算,大概可以挽回30%的流失用户。他会先私下里找到产品团队里信任的接口人,把数据
在“数据分析”层,“机器学习”仅仅被视为一个并列的功能方块,这严重低估了 AI 在现代企业中的复杂性,比如没有 Feature Store (特征存储)。右侧的“管理平台”(开发、数据管理、运维)被画成了一个独立的竖条(Sidecar 模式),与左侧的数据流是平行的。:架构图上下两端的治理体系(L1)与基础设施(L4),分别代表了企业的“顶层宪法”与“物理基石”。:架构图核心区域的控制平面(L2)
厂商笑眯眯地掏出一套PPT:隐私计算、联邦学习、多方安全计算、机密计算、差分隐私、可信数据空间……要让规则可执行,你仍然需要技术底座:身份认证、授权、策略执行、审计日志、密钥与证书、互操作标准、数据产品目录等。数据分级分类、最小化、访问控制、传输/存储加密、密钥管理、日志审计、漏洞与供应链管理,是任何方案能落地的基线。是否能被反推,取决于你共享什么、共享频率、训练配置、是否有安全聚合、是否有剪裁与
让我们从一个生动的故事入手:想象两位百万富翁偶然在街头相遇,他们各自都想夸耀自己的财富,又不愿透露具体的财务状况。他们面临的挑战是,如何确定谁更富有而不泄露各自的具体数字。这其实是隐私计算技术面临的一种经典问题。隐私计算是一组技术和方法,它们使我们能够在保护数据主体隐私的前提下,安全地存储、处理和分析数据。这些技术确保数据在加密或其他形式的保护下进行处理,从而在整个处理过程中保障数据内容的安全与隐
这个过程叫"联邦学习"(Federated Learning),整个计算还可以在"可信执行环境"(TEE,一种加密芯片)里进行,就像给保险箱再套一层金库。就像你请两个大厨(医院)用他们的独家食材(数据)做菜(训练),但你不能进厨房、不能看食材,大厨只告诉你"需要加3克盐、5克糖"(模型参数)。两家医院不会真的上传患者数据,而是在数据空间里发布一个"数据产品目录",就像在淘宝开店但只放商品介绍,货还
在DAMA中,讲数据本身管理的一共有四种数据,参考数据、主数据、元数据及文件和内容管理,以前我们讲前三者的居多,而文件和内容管理,即非结构化数据谈的很少。因为我们以前搞数据,基本还是以关系型数据库的结构化数据为主的。但随着大模型时代的到来,对非结构化数据的管理将成为下一个时代数据管理的核心,今天我就来谈一谈,希望让大家对非结构化数据有个基本全面的理解。一、引言1、非结构化数据的定义非结构化数据是指
在第一篇《读透数据治理:DGI框架全解(第一章)》中我对数据治理的六个问题进行了诠释,本篇将正式介绍DGI数据治理框架图,这是当前关于DGI数据治理框架最新最全面的解读。我们为什么需要数据治理框架呢?所有组织都需要制定关于数据管理、价值实现、成本与复杂性降低、风险管理以及遵守日益增多的法律和监管要求的决策。数据治理框架提供了一套管理数据资产的政策、程序、标准和指标,帮助组织明确复杂或不明确的概念。







