logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

2026年07月03日全球AI前沿动态

全球AI动态速览(2026.7.1-7.3) 技术突破 大模型竞赛升级:Meta筹建云算力业务"Meta Compute",美团发布国产万亿参数模型LongCat-2.0,月之暗面2.5万亿参数Kimi K3即将发布 多模态创新:谷歌推出图像/视频生成模型串联方案,NVIDIA开源双塔扩散语言模型,云上曲率语音模型登顶国际评测 垂直领域应用:气象、文旅、工业等领域涌现专业大模型,如矿山智驾模型和充

#人工智能
Kimi聊天的人太多,要排队

Kimi K2思维模型技术解析:这款原生INT4量化模型采用1.04万亿参数的MoE架构,通过384个专家模块和MLA注意力机制实现高效推理。其关键技术包括:MuonClip优化器确保15.5万亿token训练的稳定性;创新的后训练方法结合3000+真实工具库;强化学习框架VerifiableRewards实现可验证奖励机制。相比同类模型,K2在长序列处理(256k上下文)和复杂任务(200-30

文章图片
#人工智能
大数据学习前夕[01]:系统-网络-SSH

摘要:对在虚拟机上搭建前期集群环境作一个过程记录,内容分为系统安装,网络设置,SSH配置三点。系统基于Oracle VM VirtualBox虚拟机的Centos6.9操作系统,基于Nat与Host-Only网址配置,思考一下SSH的过程及相关的配置。前言:分布式系统开始于最底层的系统,有时候很想开始一场比较轰烈的学习,但都结束于开始的那一刻。很多东西都懂,就是懂得不透,懂得不够深刻。根据学

#大数据#centos
大数据学习[11]:JAVA连接elasticsearch5.6.1操作|问题|分析

摘要:通过JAVA API操作elasticsearch5.6.1的连接及连接过程中所遇到的问题,问题分析,问题解决。作为一个ES的JAVA操作的新生参考与记录。0. 官方文档JAVA操作ES的文档:https://www.elastic.co/guide/en/elasticsearch/client/java-api/current/index.html如果安装了xpack一定要查看这个

#大数据#elasticsearch#java
PEFT 框架全景:从生态定位到代码架构的整体观

文章摘要 《PEFT框架全景:从生态定位到代码架构的整体观》系统介绍了HuggingFace生态中的参数高效微调(PEFT)技术。文章首先分析了大模型全量微调面临的存储墙和显存墙问题,指出PEFT通过仅训练0.01%-1%参数即可逼近全量微调效果的核心优势。文章详细阐述了PEFT在HuggingFace生态系统中的定位,展示了它与transformers、accelerate、diffusers和

文章图片
#架构
00_DeepSpec-DSpark总览_项目地图与阅读指南

DeepSpec项目总览:训练与评测推测解码draft模型的全栈框架 DeepSpec是由DeepSeek与北京大学联合开源的项目(2026年6月发布),基于MIT协议,包含DSpark、DFlash和Eagle3三种draft算法,支持Qwen/Gemma等目标模型。项目通过"数据准备→训练→评测"三阶段流程,训练后的draft模型可提升推理速度60%-85%。代码库采用模块化设计,核心包括数据

03_DeepSpec-DSpark-DSpark建模_Markov与Confidence

本篇是 DSpark 实现的核心拆解,对应论文 Section 3.1(Semi-Autoregressive Generation)、3.2.1(Confidence Head)、3.3(Training)。DSpark 是 DeepSpec 的主角算法,本篇从 forward 13 步流程、anchor 采样、block attention mask、三种 Markov head、confid

02_DeepSpec-DSpark-核心原理_推测解码与draft模型

DeepSpec架构设计与核心思想 DeepSpec采用分层架构设计,将"训练推测draft模型"抽象为可配置的三件套:配置选择算法、模型实现算法、训练/评估编排算法。系统分为五层: 基础工具层(utils) 数据处理层(data) 模型层(modeling) 训练评估层(trainer/eval) 脚本层(scripts) 核心思想是通过配置驱动和统一抽象支持多种算法(DSpark/DFlash

#架构
01_DeepSpec-DSpark-整体架构与设计理念

DeepSpec架构设计与核心思想 DeepSpec采用分层架构设计,将"训练推测draft模型"抽象为可配置的三件套:配置选择算法、模型实现算法、训练/评估编排算法。系统分为五层: 基础工具层(utils) 数据处理层(data) 模型层(modeling) 训练评估层(trainer/eval) 脚本层(scripts) 核心思想是通过配置驱动和统一抽象支持多种算法(DSpark/DFlash

#架构
06_DeepSpec-DSpark-训练框架_FSDP与BF16优化器

本篇在总分总中是"分"的训练侧深度拆解。DSpark 训练的难点不在算法(已在讲清),而在工程:如何用 8 卡 GPU 把 5 层 draft 模型训到收敛、如何在 bf16 下稳定优化、如何应对 hfai 抢占式调度、如何恢复训练。本篇拆解10 步初始化、训练循环、FSDP 分片、BF16 master 权重、checkpoint 保存/恢复。

#机器学习#人工智能#算法
    共 437 条
  • 1
  • 2
  • 3
  • 44
  • 请选择