logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

李宏毅深度学习课程实战指南

深度学习是机器学习的一个子领域,其核心在于通过多层次的非线性变换,从原始数据中自动提取高层次的抽象特征。与传统机器学习模型相比,深度学习模型通过“端到端”的方式,省去了大量人工特征工程的步骤。其基本思想是模拟人脑神经元的连接方式,构建多层网络结构,实现对数据的复杂建模与推理。构建一个适合图像分类任务的CNN模型,通常包括多个卷积层、池化层和全连接层。以下是一个自定义CNN模型的PyTorch实现:

ms-swift零基础入门:5分钟快速微调Qwen3大模型

本文介绍了基于星图GPU平台,如何通过ms-swift镜像实现Qwen3大模型的快速微调。该平台支持ms-swift镜像的自动化部署,用户无需配置复杂环境,仅需简单操作即可完成模型训练与推理。典型应用场景包括使用LoRA对Qwen3-7B-Instruct进行指令微调,适用于AI应用开发、智能对话系统等个性化模型定制需求。

ollama部署本地大模型|embeddinggemma-300m中文语义检索专项优化

本文介绍了如何在星图GPU平台上自动化部署【ollama】embeddinggemma-300m镜像,以构建本地化的中文语义检索系统。该轻量级模型能将文本转换为向量,通过星图GPU平台快速部署后,可高效应用于文档智能搜索、内容归类等场景,实现精准的语义匹配与信息检索。

AutoGen Studio模型部署:Qwen3-4B Kubernetes集群配置

本文介绍了基于星图GPU平台自动化部署AutoGen Studio镜像的实践方法,结合Kubernetes集群高效运行Qwen3-4B模型。通过vLLM加速推理服务,实现低代码构建多智能体AI应用,典型应用于模型微调与AI代理开发,显著提升大模型部署效率与可扩展性。

S3C2440裸机环境下串口中断与MMU中断向量表重映射实战

0x50000004Bit名称功能10:900=中断请求,01=轮询,10=DMA8:7同上,接收中断类型6使能超时中断5错误状态中断使能4自环测试3发送BREAK信号2强制发送空闲1强制接收模式0推荐配置:发送/接收均使用中断模式,时钟选PCLK → 设置为0x245。

小智音箱采用LIS3DH检测用户运动行为

博客介绍了基于LIS3DH三轴加速度传感器的智能音箱运动行为检测技术,涵盖传感器原理、数据采集、特征提取、轻量级模型部署及系统优化,实现低功耗、高精度的多模态交互与异常行为识别。

大模型推理瓶颈破解:vLLM连续批处理技术实战

本文深入解析vLLM的核心技术——连续批处理与PagedAttention,揭示其如何提升大模型推理吞吐量5-10倍,降低延迟与显存占用。通过真实案例对比和生产部署实践,展示其在高并发场景下的显著性能优势。

#vLLM
为什么说Qwen3-32B是当前最具性价比的大模型之一?

Qwen3-32B以320亿参数实现接近70B级模型的性能,支持128K上下文和多任务处理,单张A100即可部署,结合高效架构与优化推理技术,在中文理解、代码生成和长文本处理方面表现突出,显著降低企业AI落地成本。

可视化AI开发利器:LangFlow让你秒变大模型架构师

LangFlow将复杂的语言模型流程转化为可视化的节点连接,让非开发者也能快速搭建RAG、智能客服等应用。通过拖拽组件、实时调试与一键导出代码,极大降低LLM开发门槛,推动团队协作与原型验证效率。

大模型推理太贵?用TensorRT优化后每Token成本直降60%

大模型推理成本高制约AI落地,TensorRT通过层融合、精度量化、内核调优和动态形状支持,在几乎无损精度的前提下显著提升推理速度。实测显示,Llama-7B在T4 GPU上单token延迟从82ms降至24ms,吞吐提升3倍,每百万token成本下降60%,为企业规模化部署提供高效低成本方案。

    共 860 条
  • 1
  • 2
  • 3
  • 86
  • 请选择