logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

一起读《大模型驱动的具身智能:架构、设计与实现》- 注意力机制Attension Mechanism

本文探讨了大模型中注意力机制的工作原理与实现。通过分析《Attention Is All You Need》论文,作者解释了Query、Key、Value三个向量的作用:Query确定关注点,Key存储信息,Value提供具体内容。文章展示了一个8维特征空间中的示例,演示了位置、速度、墙壁、目标等概念间的注意力权重关系。最后提供了一个完整的PyTorch实现代码,包括SelfAttention类和

文章图片
#人工智能#python#开源
一起读《大模型驱动的具身智能:架构、设计与实现》- 世界模型 World Model

,具备进行反事实推理 Counterfactual Reasoning 的能力(对已经发生的事,假设一个 “与事实相反的条件”,推理会出现什么结果,发散、正推、反推,没见过场面也不怕)无论具身本体面对的是结构化场景还是繁杂多变的场景,不管是通过rule-based还是learning-based的范式,最终回到程序的编码世界中如何进行表示,如何执行?下面两个在线 web,根据提供的信息进行泛化,理

文章图片
#python#人工智能
手把手 LoRA 微调 Qwen2-VL|VLM 训练

本文介绍了如何使用LoRA对视觉语言模型Qwen2-VL-7B-Instruct进行微调。主要内容包括:1) 处理器和模型的加载,展示如何同时处理图像和文本输入;2) LoRA配置方案,冻结原始权重仅训练小矩阵;3) 合成数据集的创建方法,通过PIL生成含中英文的测试图像;4) 训练流程实现,使用SFTTrainer进行监督微调;5) 推理测试环节,演示如何加载微调后的模型进行视觉问答。整个过程在

文章图片
#人工智能#spark
轻量化微调 Qwen2.5 LoRA 训练全流程详解

本文介绍了使用LoRA技术对Qwen2.5-0.5B-Instruct模型进行轻量级微调的全过程。主要内容包括:1)通过ModelScope加载0.5B参数量的基座模型;2)使用PEFT库配置LoRA(秩r=16),仅训练0.2%参数(约100万);3)采用ChatML格式构建3条对话样本进行微调训练;4)演示如何合并LoRA权重并进行推理测试。该方法在消费级硬件上即可实现,微调后模型能准确回答&

文章图片
#大数据#spark#人工智能
一起读《大模型驱动的具身智能:架构、设计与实现》- ViT 视觉 Transformer

本文介绍了基于ViT(Vision Transformer)的MINIST手写数字识别实现。通过将28×28的灰度图像分割为4×4的patch,使用卷积层将每个patch映射为64维向量,并添加cls_token和位置编码。构建了一个包含2层Transformer编码器的小型ViT模型,使用交叉熵损失和Adam优化器进行30轮训练。实验表明该模型能有效学习图像特征,实现手写数字分类。代码提供了训练

文章图片
#transformer#深度学习#人工智能
一起读《大模型驱动的具身智能:架构、设计与实现》- 混合控制架构

本文探讨了大模型驱动的具身智能在动作规划与控制架构中的实现方法。重点分析了直接动作规划(需处理连续运动轨迹离散化问题)和间接动作规划(生成辅助信息)两种方式,指出分层架构存在信息丢失风险,建议通过预训练具身大模型优化性能。同时介绍了传统基元级(运动学计算)和伺服级(硬件控制指令)规划方法,包括数值解法、优化方法和强化学习等实现路径。文章通过多个实验案例(如机械臂IK/FK控制、PPO强化学习等)展

文章图片
#人工智能#python
DGX Spark安装Ollama及本地部署Qwen3.5 122b

这段视频演示了在DGX Spark上安装Ollama并本地部署Qwen3.5 122B大模型的过程。主要内容包括:1)通过命令行安装Ollama;2)下载122B参数的Qwen3.5模型(ollama pull指令);3)运行模型时观察到占用近90GB内存,温度达70℃;4)指出未量化版本响应速度较慢,性能表现欠佳,但强调这是122B参数量与有限内存带宽的原始状态。视频链接提供了完整操作演示。(1

文章图片
#人工智能#python
ollama 直接运行 gguf 模型踩坑细节(io timeout以及System message...)

本文介绍了在使用ollama部署Qwen大模型时遇到的两个问题及解决方法。首先是在从HuggingFace下载模型时出现I/O超时错误,建议检查网络连接或使用代理重试。其次是模型运行时报错"System message must be at the beginning",这是由于Qwen GGUF格式模型对系统消息位置的严格限制导致的。作者提供了Python脚本解决方案,通过修

文章图片
#人工智能#python
DGX Spark 开箱,金贵金贵的小玩意

【摘要】博主开箱DGX Spark迷你主机,吐槽其重量惊人但最终因CUDA生态等优势选择购入。设备虽被诟病性价比低(内存带宽不足、散热差、X7接口鸡肋),但128G共享内存支持大模型微调、原生PCIe5.0 4T硬盘及精致外观成为选购关键。开箱含主机、240W大电源和说明书,接口配置丰富但ConnectX7实用性存疑。系统预装Ubuntu24.04,20分钟完成初始设置后博主满意展示配置信息,准备

文章图片
#人工智能#深度学习
DGX Spark本地部署open-webui通过ollama (解决无法显示模型)

摘要:本文介绍了在Docker环境中部署Open WebUI并连接本地Ollama模型的完整流程。主要步骤包括:1) 通过Docker拉取Open WebUI镜像并运行容器;2) 修改Ollama服务配置使其监听所有网络接口;3) 测试容器与Ollama的连通性;4) 在WebUI中配置本地模型地址。过程中遇到网络访问限制问题,通过修改Ollama的监听地址解决。最后提到模型运行速度较慢及占用90

文章图片
#spark#大数据#分布式
    共 37 条
  • 1
  • 2
  • 3
  • 4
  • 请选择