logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

人工智能NLPPython数据挖掘

可提供的服务

暂无可提供的服务

第四章 文本数据清洗:去重、分段、规范化、脏词与格式纠错(先把数据“训得动”,再谈模型“训得好”)

本文提供了一套完整的私有数据清洗管线方案,重点解决数据质量而非数量问题。通过规范化、分段结构化、精确/近重复去重、异常过滤、脱敏和格式纠错等步骤,将原始文本转化为高质量训练资产。文章强调可解释性、可复现性和可审计性,提供了包含两层去重策略(MinHash/SimHash)、结构化分段方法和异常检测规则的实施方案。核心交付物包括可扩展的清洗管线脚本骨架(支持模块化扩展和版本控制)和通用数据schem

文章图片
Runpod Serverless 从 0 到 1:本地跑通 → 镜像构建 → Endpoint 部署 → 在线压测(保姆级踩坑版)

本文提供了一个从零开始使用Runpod Serverless的完整指南,包含本地测试、镜像构建、Endpoint部署和在线压测的全流程。主要内容包括:1) 准备工作;2) 开发环境搭建;3) 编写最小可用的handler.py模板;4) 本地测试方法;5) 构建Docker镜像的关键注意事项;6) 控制台部署Endpoint步骤;7) 在线测试流程。

文章图片
#serverless#云原生
RunPod Serverless + vLLM:大语言模型部署与配置指南(实战版)

本文介绍了如何利用RunPod Serverless和vLLM快速部署开源大语言模型。主要内容包括:1) 通过RunPod控制台直接部署vLLM Worker,支持Hugging Face模型;2) 关键配置参数如显存管理(GPU_MEMORY_UTILIZATION)和上下文长度(MAX_MODEL_LEN)的优化建议;3) 两种API调用方式(RunPod原生和OpenAI兼容接口);4) 常

文章图片
别让你的私有大模型死在“实验室”:从散装实验到标准化工程闭环

本文揭示了私有化大模型落地失败的核心原因——缺乏工程闭环,而非技术问题。作者提出标准化实践路径:1) 定义结构化数据契约;2) 通过manifest实现数据版本化;3) 使用Axolotl确保训练可复现;4) 构建回归集作为上线门禁;5) 建立失败样本反馈机制。文章强调模型交付应从"实验室玄学"转为包含数据治理、训练编排、评测验证的工程体系,并提供7天实施清单和验收标准,帮助开

文章图片
突破大模型推理天花板:基于 GraphRAG 的多跳推理与隐式因果关系挖掘深度指南

GraphRAG:知识图谱与大模型协同的因果推理架构 摘要:本文提出GraphRAG架构,通过知识图谱增强大模型的因果推理能力。传统RAG依赖向量相似度检索,无法捕捉数据间的隐式因果关系。GraphRAG将非结构化数据转化为结构化属性图(实体-关系网络),实现多跳推理:1)基于图注意力网络动态计算跳转路径;2)引入反事实检验验证因果关系。核心创新在于融合图神经网络与因果推断理论,使AI系统能像人类

文章图片
#RAG
从 CUDA OOM 到彻底榨干 GPU:DeepSeek 等大模型高效推理与部署全攻略

本文深入剖析大模型部署中的显存瓶颈问题,以DeepSeek-V3为例,系统分析显存占用的四大来源(模型权重、KV缓存、激活值、运行时上下文),并通过量化、动态优化、分布式扩展等策略提供解决方案。文章包含工业级诊断工具和实战代码,帮助开发者在资源受限环境下高效部署大模型,涵盖INT8/INT4量化、FlashAttention优化及vLLM集群部署等关键技术。

文章图片
#DeepSeek
用 Python + OpenAlex + 国产大模型,给毕业论文造一个选题侦察兵

当 OpenAlex 的图谱每天以百万级的速度自我演进,当国产大模型的成本每年下降一个数量级,研究的入口正在被彻底重新定义。此时,我们不妨做一个互动思考:当未来学术知识图谱 100% API 化、大模型生成的候选选题质量超过 80% 的初级研究者时,研究生还需要“想“选题吗,还是只需要“评审“选题?或许,作为新一代的研究者和工程师,我们的根本任务早已不是“手动找选题“,而是“为自己构建一个能持续产

文章图片
#python#开发语言
用 Python + OpenAlex + 国产大模型,给毕业论文造一个选题侦察兵

当 OpenAlex 的图谱每天以百万级的速度自我演进,当国产大模型的成本每年下降一个数量级,研究的入口正在被彻底重新定义。此时,我们不妨做一个互动思考:当未来学术知识图谱 100% API 化、大模型生成的候选选题质量超过 80% 的初级研究者时,研究生还需要“想“选题吗,还是只需要“评审“选题?或许,作为新一代的研究者和工程师,我们的根本任务早已不是“手动找选题“,而是“为自己构建一个能持续产

文章图片
#python#开发语言
OpenClaw 落地指南:在 Windows 本地零基础部署 OpenClaw 与自动化强化学习 (RL) 系统

OpenClaw作为2026年爆发的AI Agent框架,凭借模块化设计、多模型支持和强化学习能力,正在重塑AI应用开发范式。本文从架构设计到实战部署,详细介绍了在Windows环境下搭建OpenClaw系统的全流程,包括硬件配置、安装指南、智谱GLM-4模型集成,以及强化学习调优等关键技术。通过高校智能助教系统的案例,展示了如何实现从基础对话到自主进化的完整AI Agent闭环。文章特别强调GR

文章图片
#windows#自动化#运维
第一章:Python 学习路线图:从 0 到 1 的最短闭环

这篇Python学习专栏采用"先交付再系统化"的实践教学法,通过20篇教程帮助零基础学习者快速入门。每篇教程聚焦一个可验证的交付物(如文件批处理工具、数据清洗报告等),包含真实问题、最小可行结果、复用模板和常见问题解答。学习路径从基础语法到数据分析循序渐进,强调通过积累可运行代码模板库来突破入门门槛。专栏还指出了进阶学习可能遇到的三大瓶颈,并推荐了付费进阶课程。学习方法强调&q

文章图片
#python#学习#开发语言
    共 50 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择