logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Lance Meetup 2026 · 上海站|正式开启报名!

当 AI 迈向多模态、具身智能与大规模训推,数据基础设施如何平衡成本、性能与治理?Lance & LanceDB 中文社区 · 上海站线下沙龙将于 9 月 12 日正式举办,这也是上半年继北京站之后,社区在国内举办的第二站城市沙龙。届时,LanceDB 核心成员将携手一线云厂商、芯片厂商与互联网企业技术专家,围绕多模态数据、具身智能、向量存储与开源生态,与你面对面畅聊技术实践。

文章图片
#大数据
火山引擎多模态数据湖解决方案,以新一代数据基座迎接AI Agent时代

在存储层,Lance格式支持多模态数据列式存储,实现高压缩比与灵活Schema变更,在实际生产中,100G 的 Tensor 数据经 Lance 压缩后可降至 2G,大幅节省存储成本;例如,存储端面临多模态数据统一存储与高性能点查的需求,计算端需实现CPU与GPU的高效协同,而管理端需打破结构化与非结构化数据间的壁垒。面向未来,火山引擎将持续深化多模态数据湖能力,并强化与开源社区的协作。火山引擎推

#大数据#人工智能
字节跳动嵌入式数据分析最佳实践

Step 1. 获得目标仪表盘/图表的URL链接Step 2. 链接修改Step 3. 生成代码该开发人员建议在需要操作的项目中赋予项目管理员权限,完成后再根据实际情况赋予权限。

文章图片
#数据分析#数据库#前端
字节跳动基于火山引擎DataLeap的一站式数据治理架构实践

针对这个问题,字节跳动采用了一种实践方法,通过 HDFS 和引擎侧的深度合作,对数据进行打标,从而将各种数据的引擎来源和表的映射关系进行聚合,最终在 HDS 的审计层上,能够获得各种存储的访问来源,从而实现精细化和准确化的治理判断。传统的数据治理模式,治理目标通常是一致的,自上而下地在组织中推进,以运动式的方式发起治理。由于每个业务的治理目标不同,每一个发展较快的业务面临的数据治理问题,在今后,可

文章图片
#火山引擎#架构
火山引擎 DataLeap:3 小时分享,体系化讲透企业数据治理如何做?

1.出品人:李晓菲 火山引擎 DataLeap 产品专家2.周方圆 火山引擎 DataLeap 资深研发工程师演讲题目:智能化、自动化,揭秘字节跳动数据质量前沿探索从应用场景视角来看待数据质量问题,通过自动化、智能化技术让数据质量可以被“观测”。把数据质量融入在研发、协作的流程中。1. 了解如何通过智能化的工具提升数据质量2. 交流数据可观测性的前沿进展3.韩谋让 火山引擎 数据治理专家演讲题目:

文章图片
#火山引擎#数据库#大数据 +1
数据分析引擎百花齐放,为什么要大力投入ClickHouse?

近年来,OLAP产品的竞争日渐激烈,目前企业间流行的既有Impala、Greenplum等上一代较为成熟的数据分析产品,也有ClickHouse、Kylin、Druid、Doris、StarRocks等在不同场景各具特色的新一代分析引擎。这些产品各有胜场,用户在进行选择时需要对各产品有全面的了解,并且要求产品知识紧跟最新版本,才能准确的选出适合自己公司的产品。字节跳动旗下抖音、今日头条等产品的成长

文章图片
#大数据
字节跳动嵌入式数据分析最佳实践

Step 1. 获得目标仪表盘/图表的URL链接Step 2. 链接修改Step 3. 生成代码该开发人员建议在需要操作的项目中赋予项目管理员权限,完成后再根据实际情况赋予权限。

文章图片
#数据分析#数据库#前端
提速 10 倍!深度解读字节跳动新型云原生 Spark History Server 原创

更多技术交流、求职机会,欢迎关注前不久,在 6月29日 Databricks 举办的 Data + AI Summit 上,火山引擎向大家首次介绍了 UIMeta,一款致力于监控、分析和优化的新型云原生 Spark History Server,相比于传统的事件日志文件,它在缩小了近乎 10倍体积的基础上,居然还实现了提速 10倍!!!目前,UIMeta Service 已经取代了原有的 Hist

文章图片
#大数据#spark#分布式 +1
火山引擎DataLeap基于Apache Atlas自研异步消息处理框架

字节数据中台DataLeap的Data Catalog系统通过接收MQ中的近实时消息来同步部分元数据。Apache Atlas对于实时消息的消费处理不满足性能要求,内部使用Flink任务的处理方案在ToB场景中也存在诸多限制,所以团队自研了轻量级异步消息处理框架,支持了字节内部和火山引擎上同步元数据的诉求。本文定义了需求场景,并详细介绍框架的设计与实现。

文章图片
#大数据
火山引擎发布《AI时代企业数据基建升级路线图》

白皮书中提到,AI时代的数据基建,核心在于构建以Token为价值流转载体的智能底座,并首次系统性地提出了企业升级数据基建应遵循的五大“北极星”原则:模型本位、安全内生、极致效能、闭环进化与生态兼容。在升级的基础阶段,企业的核心任务是突破传统单一算力的供给瓶颈,初步实现计算范式的融合,为持续增长的AI负载提供坚实支撑。此阶段的根本目标是构建一个灵活、弹性的算力供给池,使其既能充分满足AI模型训练与推

#人工智能
    共 51 条
  • 1
  • 2
  • 3
  • 6
  • 请选择