登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了如何使用DataWorks智能建模工具,通过5个步骤构建零售电商DWD层订单事实表,包括业务过程定义、维度体系设计、度量指标确定等关键环节,并附有完整的FML脚本示例。文章结合大数据和数据仓库技术,帮助数据团队高效处理百万级订单数据,满足多维度分析需求。
做电商运营、产品调研、竞品分析的朋友应该都有同一个痛点:想持续监控自家和竞品商品的用户真实反馈,手动翻页复制评价效率极低,每日几十款商品轮询几乎要耗费半天人力;拿到一堆零散评论文本后,又要人工筛选好评、差评、高频吐槽点,很难快速提炼产品优化方向。过去试过原生页面批量采集,频繁触发平台访问限制,数据漏采、拦截报错层出不穷;自建采集框架又要处理账号、延时、分页、文本清洗全套逻辑,开发周期长、维护成本高
做电商运营、竞品调研、产品迭代的同学,几乎都有同一个痛点:人工刷商品评价效率极低。多店铺、多竞品同时跟踪时,每天花几小时翻评价、筛选差评、统计用户痛点,不仅耗时,还容易遗漏突发负面反馈,错过舆情处理黄金时间。过去尝试过页面解析采集,但平台页面频繁改版、风控拦截、验证码、IP 限制等问题层出不穷,采集脚本隔三差五失效,维护成本极高。今天分享一套稳定成熟的商用数据采集方案,无需逆向页面、无需处理风控,
传统机器人电销话术死板、应对客户拒绝就卡顿,复杂对话直接掉线?沃创云搭载 AI 大模型电销系统,完美适配各类高难度沟通场景,一站式赋能企业销售全链路。
无刷电机的无传感器控制一直是个挺有意思的话题,最近在实验室里折腾基于容积卡尔曼滤波(CKF)的实现方案。无刷直流电机(BLDC)无传感器控制,采用的是容积卡尔曼观测,能够很好的估计转速和转子位置,有对应的simulink文件跟ckf代码,ckf由s函数编写,提供模型说明和参考文献。无刷直流电机(BLDC)无传感器控制,采用的是容积卡尔曼观测,能够很好的估计转速和转子位置,有对应的simulink文
本数据集提供了2003年至2022年中国大陆地区1千米分辨率的逐日气温数据,包括每日最高温、最低温和平均温。数据基于四维时空深度森林(4D-STDF)模型,融合了地表温度、气象再分析、地形、植被指数、人口密度等。覆盖2003年至2022年,空间范围为中国大陆地区,分辨率1千米,逐日更新。数据分为每日最高温、每日最低温、每日平均温三类,坐标系为WGS。该数据集以TIFF格式存储,可直接用于ArcGI
个标准深度(0、10、30、60、100 和 200 cm)处的土壤含砂量百分比(单位:kg/kg)。数据基于对全球土壤剖面和样本的汇编,采用机器学习方法进行空间预测,生成空间分辨率为 250 m 的栅格图层。所有文件均以TIFF格式存储,数据集可应用于土壤质地空间分布制图、土壤侵蚀敏感性评价、水文过程模拟(如入渗、产流参数估算)、农业区划与土地资源评价、以及气候变化背景下土壤性质演变分析等研究。
数据科学作为现代企业数字化转型的核心驱动力,其技术体系涵盖数据仓库、机器学习工程和算法优化等关键领域。数据仓库通过分层架构实现数据价值提炼,而数据湖技术则面临元数据管理的核心挑战。在工程实践层面,Snowflake与Power BI等工具的深度整合,以及地理空间数据分析技术,正在推动零售、物流和城市规划等行业的智能化升级。本次研讨会汇聚Bill Inmon等行业领袖,深入探讨数据治理、ML团队建设
本数据集以美国陆地卫星Landsat 遥感影像数据作为主信息源,通过人工目视解译和机器学习方法,建立了1985-2025年国家尺度1:10 万比例尺41期土地利用/土地覆盖遥感监测数据集,并根据多场景应用需求,将数据集处理为100m分辨率。数据制备过程中,采用由中国科学院地理科学与资源研究所刘纪远先生提出的CNLUCC分类体系,数据覆盖全国陆地区域,具备年度时间分辨率和高空间尺度特征。最终采用Ka
做淘宝、无货源、跨境铺货的卖家,最头疼两件事:一是手动翻竞品数据效率极低,二是自建网页爬虫频繁触发平台风控、频繁封 IP。很多运营每天花几小时记录竞品价格、销量、评价、活动优惠,数据滞后还容易出错,错过蓝海品、低价截流机会。最近一直在用 OpenClaw 开源智能调度框架,对接标准化淘宝商品详情 API(item_get_pro),实现全自动定时采集、数据入库、竞品异动告警,不用维护复杂爬虫,稳定
如果有一天,在 WhaleStudio 中创建同步任务、编写 SQL、搭建 DAG、排查任务异常这些工作都能交给 Agent 自动完成,那么数据工程师的价值还体现在哪里?未来的数据平台又该扮演怎样的角色?带着这样的思考,白鲸开源 CEO 郭炜亲自录制了一段基于 WhaleStudio 与Snowflake的实践演示视频。作为长期深耕数据基础设施领域的技术创业者,他在持续打磨 WhaleStudio
自动化立体仓库市场快速发展,中国企业占比提升 近年来,自动化立体仓库成为仓储物流的升级方向,市场规模持续扩大。数据显示,2025年全球智能立体仓储市场规模将达381.8亿元,中国自动化立体仓库数量从2019年的6000座增至2024年的超11000座。国内企业市场份额从2020年的32%提升至2025年的51%。 行业主要企业分为两类:第一梯队包括北自科技、荣联汇智、诺力股份、今天国际,提供一体化
通过DeepSeek的语义理解能力,合同要素提取准确率达到98.7%——无论格式如何、表述如何,关键信息被统一拆解、标注、入库。道本鹰眼审查矩阵的机制,是把每一次审查过程中产生的审核意见——业务提出的、法务标记的、财务关注的——全部自动采集,通过DeepSeek持续训练,迭代下一轮的审查逻辑。更重要的是,系统结合DeepSeek自动生成风险总结报告——不是简单的“有几条预警”,而是从风险领域、风险
谷云ETLCloud通过轻量化数据底座与AI智能体融合,实现数据自动流转与业务闭环,搭载AI异常分析、Java/SQL自动生成三大功能,降低开发运维门槛,助力企业低成本快速完成智能化转型。
本文介绍了作者从Obsidian转向IMA知识库的原因及使用体验。主要痛点在于Obsidian的同步问题和移动端AI协作不便,而IMA知识库无缝对接WorkBuddy,提供多端同步和AI辅助功能。文章详细讲解了IMA的下载安装、连接WorkBuddy的方法,并介绍了个人、共享和订阅三种知识库类型的使用场景。作者分享了使用技巧,包括上传资料、通过WorkBuddy深度分析、直接使用客户端AI功能等,
Claude Code -> 添加新供应商 -> 自定义配置字段值供应商名称API Key后台生成的Key请求地址请求地址不要在末尾手动追加,Claude Code 会自动请求该路径。"env": {},"deny": []会通过前面配置的分组映射转到。保存供应商并点击“启用”。安装 Docker Desktop-> 本机启动 Sub2API + PostgreSQL + Redis-> 本人完成
数据治理需要全链路技术支撑,PowDG提供18款产品打通数据全生命周期。核心模块包括:1)PowETL零代码可视化集成引擎,支持实时与批量处理;2)自研MPP列存分布式存储引擎,兼容MySQL协议,查询性能提升150倍;3)六合一治理中台实现元数据、质量、安全等统一管理;4)小思智能助手通过Text2SQL实现92%准确率的自然语言查询。方案优势在于全栈自研无兼容性问题、10PB级生产验证、AI深
沃创云作为销售全链路赋能平台,整合外呼系统、智能 CRM、AI 机器人外呼等功能,打造拓客、触客、管客一体化解决方案。沃创云 7×24 小时稳定运行,有效规避卡顿、掉线、闪退故障,保障外销工作不间断。搭载自动外呼、前置筛号功能,过滤无效号码,减少人力时间浪费,大幅提升线索筛选与人效。不少企业做电话拓客时,常会遭遇系统频繁掉线、通话杂音多、外呼效率低下等难题。覆盖多运营商、多地域号码资源,适配各行各
摘要: 随着具身智能被纳入高校本科专业,如何开设相关课程成为现实问题。当前高校面临设备到位但课程难落地的困境,核心在于缺乏数据流水线体系,表现为设备异构、数据孤岛、算力流程断裂等五大障碍。文章提出将课程设计为数据流水线实践,分采集、清洗、标注、质检、交付五环节,确保学生产出可用的数据资产而非实验报告,并强调与教务系统对接的必要性。解决方案包括数据采集基地、开源平台及配套课程体系,最终目标是培养具备
摘要(148字): 本文探讨具身智能数据标注的核心挑战与优化方案。相比CV标注,具身智能需处理多模态数据(图像、点云、音频等)、时序动作分段及关系意图标注,且错误影响全局。提出AI预标注+人工精修的协同框架:针对六类模态推荐12种模型(如YOLOv8、SAM、Whisper等),通过置信度与任务类型分流,将人工介入聚焦于低置信度、时序异常及主观判断(如三维朝向、透明物体)。关键效率提升在于工具快捷
摘要:本文介绍了数据交付前必须检查的八个质量维度,这是确保数据集有效性的关键环节。通过一个真实案例揭示了数据泄漏问题(同一轨迹的相邻帧被分到训练/验证集),强调质量检查的重要性。八个维度包括:完整性(数据无缺失)、准确性(标注正确)、一致性(标注标准统一)、规范性(格式合法)、唯一性(无重复/泄漏)、代表性(覆盖应用场景)、均衡性(分布合理)、可用性(文件可读取)。文章指出各维度优先级不同,建议将
文章摘要 MotherDuck推出Guides功能,为AI智能体提供数据仓库内的上下文层,显著提升智能体处理数据的准确性。在基准测试中,Guides将查询错误减少99%,成本降低55%。Guides以Markdown文件形式存储于数据仓库中,包含业务指标定义、连接关系等关键信息,支持SQL管理和版本控制。该功能现向所有用户开放,可通过文档快速上手。
本文系统剖析了Redis的核心架构与关键技术。Redis作为开源内存数据库,支持10万+ QPS,延迟低至亚毫秒级。文章从四个维度展开: 核心架构:采用单线程模型+epoll多路复用,通过RESP协议通信,包含键空间字典和过期字典的双字典设计。 数据结构:采用逻辑类型与物理编码分离的两层架构,自动选择最优编码(如SDS字符串、跳表、压缩列表等),实现高性能操作。 性能优化:纯内存操作、高效数据结构
2025年是中国“十四五”规划的收官之年,中国水务行业正加速从“增量扩张”向“质量提升”转型,迈入高质量发展的产业化新阶段。智慧水务作为水务行业数字化转型的核心赛道,通过新一代信息技术与水务技术的深度融合,已成为提升水资源利用效率、保障供水安全、驱动行业智慧化变革的关键力量。本概览从市场规模、技术路径、竞争格局及未来趋势四个维度,梳理2025年中国智慧水务行业的发展全貌。
数据中台在过去十年经历了从传统数据仓库到湖仓一体化的演进,但大语言模型(LLM)的出现正在从根本上改变数据中台的定位与架构范式。本文探讨大模型如何促使数据中台从"数据供给平台"升级为"认知决策引擎",并提出一种融合大模型能力的新一代数据中台参考架构。大模型不是数据中台的替代者,而是催化其质变的触发器。当数据中台从"数据供给"走向"认知供给",其定位将从 IT 支撑系统升级为企业智能决策的核心基础设
本研究设计了一种基于LSTM的上市公司金融风险预测系统。通过挖掘金融数据,利用LSTM的时序处理能力提升预测准确性。研究详细介绍了系统架构、数据预处理和模型优化方法,实证验证了系统在风险识别和预警方面的有效性。系统为投资者和监管机构提供了决策支持,并探讨了应用中的技术经济可行性。未来将扩展数据源和优化算法以提升性能。该研究兼具理论价值与实践意义,有助于维护金融市场稳定。
房价数据分析系统整合多源房地产数据,通过清洗、整合和高级分析技术(时间序列、回归分析、机器学习等),提供实时、准确的房价趋势分析。系统具备数据收集、预处理、深度分析和可视化功能,可生成走势图、区域对比等直观报告,支持用户自定义查询。该系统为开发商、投资者和购房者提供决策支持,帮助把握市场动态,优化房地产相关决策。
我们从来不需要识别文字,我们需要的一直是理解文档。
摘要:本系统基于YOLO目标检测算法、Django框架和深度学习技术,构建了一套高效医学图像分类解决方案。系统采用Python开发,通过标准化预处理(格式转换、去噪增强、灰度二值化)确保图像质量,结合YOLO实现实时检测。管理员可通过交互式控制台进行用户管理、图像上传检测,并查看识别趋势统计图表。功能模块包括:1)用户管理系统;2)智能图像处理流水线;3)可视化数据分析界面。系统在保证检测精度的同
本文探讨了基于大数据的商场管理辅助决策系统设计与实现。针对传统商场管理经验主义模式的不足,研究采用Spark、Hadoop、机器学习等技术,结合Python、MySQL和Vue框架,构建了包含前台展示、后台管理和数据爬取三大模块的智能决策系统。系统通过采集分析消费行为、销售数据等多维度信息,实现用户行为预测、库存优化和精准营销,为商场管理提供数据支撑。重点介绍了数据可视化大屏的设计,能够全面直观展
SHEIN 不同部门、团队、业务线差异比较大,我不替所有团队背书。或者官网投递,填我的内推码。同一岗位也可以结合 BOSS 上的薪资来看,最终薪资、职级和 offer 结构以面试及 HR 沟通为准。如果实在不确定适合哪个方向,或者不确定简历匹配度,可以填图二岗位匹配收集表,我来帮忙判断。我是 SHEIN 员工,不是 HR ,这帖只是员工内推信息整理,不代表官方招聘口径。做过互联网、电商、广告、推荐
本研究基于深度学习和YOLOv11模型,提出了一种垃圾分类与管理系统,旨在解决传统垃圾检测中的效率低、精度不高等问题。随着垃圾问题的日益严重,传统的人工巡检和手动分类方法已经无法满足现代环境保护的需求,因此,需要一种自动化、精准的垃圾识别与管理方案。YOLOv11作为一种基于卷积神经网络的目标检测算法,具有较快的检测速度和较高的准确度,本研究通过对YOLOv11模型进行适当的调整与优化,提升了其在
本文介绍了一种基于机器学习的量化选股系统设计,该系统整合Spark分布式计算、网络爬虫和梯度提升树技术,构建高效精准的选股模型。系统通过爬虫实时采集股票行情、舆情和财务数据,利用Spark进行海量金融数据清洗与分析,采用梯度提升树算法进行特征工程和模型训练,并通过交叉验证优化参数。模型部署后可通过Spark Streaming实现实时股票推荐,同时支持从天天基金网获取基金申购状态数据(开放申购/限
数据仓库、数据湖和特征存储是企业数据架构中三个互补的层级系统,各有不同定位。数据仓库用于结构化业务分析和BI报表;数据湖存储全量原始数据,支持探索式分析;特征存储则专注于机器学习特征的全生命周期管理。三者协作形成数据流转体系:数据湖为底层数据源,数据仓库加工业务分析数据,特征存储提供模型所需特征数据。选型需根据业务需求,分别适用于传统分析、数据探索和机器学习场景。三者并非替代关系,而是共同构建完整
1234个阶段。
一个做了四年Python数据工程的程序员,在团队缩编的那天,发现数据清洗的活儿AI也能干了。
搭建一个大模型Demo只需要一个下午,但把它变成可持续的商业产品,可能需要一年甚至更久。
我写了五年Hive SQL,优化过几十张宽表,处理过上PB的数据,拿过两次季度的“数据治理标兵”。但在公司决定做行业大模型的那天,我被一句话问懵了。
先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做,以及从哪里动手。摘要:很多数据工程师以为转做大模型就是学 Python、调 LangChain。实际上,当 Demo 跑通后,真正决定项目能否上线的,是权限管控、日志追踪和异常兜底。本文复盘一个将传统数仓改造为 RAG 管道的真实案例,探讨数据治理在新架构下的核心地位,以及为何“脏活累活”才是转型的关键壁垒。---从大数据转向大模型
沃创云 AI 外呼适配财税、教育、法律服务、商贸等众多行业,大幅缩减企业人力开支,线索触达效率提升数倍。人工拨号耗时、人员流动性大、获客成本攀升,外加外呼监管严苛、高频拨打电话极易封号,很多企业拓客陷入瓶颈。系统可批量导入线索,自动筛除空号、停机号码,7×24 小时不间断开展外呼工作,单日可完成上千通拨号。AI 搭载真人仿真语音,支持多轮对话和实时打断,智能判断客户需求,自动划分高、中、低意向客户
数据仓库
——数据仓库
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net