logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【大数据技术详解】——Hive 离线数仓分层(学习笔记)

本文详细介绍了Hive离线数仓的分层规范及实现流程。数据仓库采用经典四层架构:ODS层存储原始数据,DWD层进行数据清洗和标准化,DWS层实现轻度汇总,ADS层生成业务指标。通过用户行为日志分析示例,展示了从原始JSON数据到最终报表的完整ETL流程,包括建表语句、数据转换逻辑和分区管理。文章还提供了数据导出到MySQL的方案(推荐使用Spark),并给出Airflow调度任务示例。最后强调分层设

文章图片
#hive#hadoop#数据仓库
【大数据技术详解】——Sqoop技术(学习笔记)

Sqoop是Apache开源的数据迁移工具,专为关系型数据库与Hadoop生态系统(HDFS/Hive/HBase)之间批量数据传输设计。其核心功能包括并行导入导出、增量同步、数据类型自动映射等,通过MapReduce实现高吞吐量传输。虽然Sqoop在传统Hadoop数仓建设中发挥重要作用,但随着技术发展,其局限性(如依赖MapReduce、分片限制)逐渐显现,正被Spark JDBC等新方案替代

文章图片
#大数据#sqoop#学习
【大数据技术详解】——HBase技术(学习笔记)

HBase是一个基于Hadoop的分布式NoSQL数据库,具有高可靠、高性能和可扩展特性。它适合海量数据的随机实时读写场景,如用户画像、时序数据和消息状态存储。核心架构包括HMaster、RegionServer和ZooKeeper,采用稀疏多维排序映射表模型,支持水平扩展和强一致性。RowKey设计是关键,需避免热点问题。HBase可与Hive/Spark集成,但性能调优需关注Region数量、

文章图片
#大数据#hdfs#hadoop +1
【大数据技术详解】——Elasticsearch技术(学习笔记)

Elasticsearch(ES)是一个基于Lucene的分布式搜索分析引擎,具有近实时处理能力。其核心概念包括节点、集群、索引、文档和分片,采用倒排索引技术实现高效检索。ES支持水平扩展、全文检索、聚合分析和RESTful API,适用于日志分析、电商搜索等场景。进阶功能涵盖向量搜索(8.x支持dense_vector字段和kNN搜索)、跨集群搜索、数据流管理及性能调优技巧(如批量写入、查询优化

文章图片
#大数据
【大数据技术详解】——Kibana(学习笔记)

摘要:Kibana是Elasticsearch的可视化管理平台,提供数据探索、仪表板构建、日志分析等核心功能。主要模块包括Discover(日志查询)、Dashboard(可视化看板)、Visualize(图表创建)等。使用流程包括配置索引模式、数据探索、创建可视化组件和构建仪表板。高级功能支持KQL查询语言、低代码分析工具Lens、告警系统和数据源集成。典型应用场景涵盖运维监控、安全审计和业务分

文章图片
#大数据#学习
【大模型基础部署】(学习笔记)

《大模型部署全流程指南:从压缩到应用开发》系统介绍了2026年主流的大模型部署技术。在模型压缩方面,重点探讨了量化、剪枝和知识蒸馏三大技术,其中量化可将显存占用减少4-8倍,AWQ等新方法能在INT4精度下实现无损压缩。部署工具部分对比了vLLM、Ollama和Triton等框架,特别介绍了vLLM的PagedAttention技术如何提升显存利用率。推理加速章节详细分析了MoE架构和连续批处理等

文章图片
#人工智能#机器学习#深度学习
【大模型(LLM)的业务开发】学习笔记

在大模型(LLM)的业务开发中,构建一个高性能、懂指令且符合人类价值观的模型,通常遵循一个经典的“四步走”流水线。这四个阶段层层递进,分别解决了模型“懂知识”、“懂指令”、“懂好坏”和“懂对齐”的问题。

文章图片
#人工智能#算法#机器学习
【基于vllm部署kimi-2.6大模型部署需要考虑的条件】

本文是一份详细的vLLM部署指南,主要介绍如何基于vLLM框架部署kimi-2.6大语言模型的API服务。文章包含以下核心内容: 前置知识:解释vLLM推理引擎和kimi-2.6模型的特点,包括247B参数量的MoE架构和128K上下文长度优势。 硬件要求:提供显存计算公式和不同显卡配置建议,推荐24GB显存使用int4量化版本。 部署步骤: 环境准备(驱动、Python、CUDA) vLLM安装

文章图片
#人工智能#学习#机器学习
【LangChain 大模型6大调用指南】调用大模型篇

本文介绍了LangChain调用大模型的6种方式,分为同步和异步两类。同步调用包括普通调用(invoke)、流式调用(stream)和批量调用(batch);异步调用包含异步普通调用(ainvoke)、异步流式(astream)和异步批量(abatch)。文章详细说明了每种调用方式的特点、适用场景和代码示例,并比较了同步与异步调用的选择策略。此外,还介绍了三种核心消息类型(SystemMessag

文章图片
#linux#运维#服务器 +2
【大模型vLLM 使用】学习笔记

微调不是为了训练,是为了用。LLaMA-Factory 给你一个补丁,vLLM 把你的补丁变成服务。

文章图片
#学习
    共 93 条
  • 1
  • 2
  • 3
  • 10
  • 请选择