logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-V4-Pro模型配置解读

这是DeepSeek V4 超大规模稀疏 MoE 大模型384 个专家,每 token 激活 6 个1048576 超长上下文(YaRN 扩展)FP8 量化 + GQA 注意力,高效部署支持LoRA 微调 + 哈希检索增强属于当前开源顶尖的长文本大模型附(flash与pro对比):分类参数项小参数量:DeepSeek-V4-Flash大参数量:DeepSeek-V4-Pro差异说明🏷️ 模型基础

文章图片
#人工智能
01-整体观 — Cordis 项目全貌解读

本文是Cordis v4框架系列文章的首篇,聚焦于"整体观"视角。Cordis v4是一个可组合性元框架,其核心创新在于解决了动态组合软件的两大难题:时间可组合性(通过可逆效果机制实现副作用完整回滚)和空间可组合性(通过响应式余效果机制管理组件依赖)。文章从项目定位、生态方位、代码结构三个维度展开,指出Cordis作为Koishi生态和DeepSeek Harness的底层框架,采用"内核+插件"

文章图片
#算法
Codex黄金闭环:9个阶段,把AI编程助手变成工程级Agent

Codex高效使用的核心在于构建闭环工程流程 本文提出Codex的高效应用不依赖于复杂Prompt或更大模型容量,而是围绕交付闭环展开,其核心流程为: 明确边界:通过项目结构(如AGENTS.md)限定任务范围,减少无关干扰 规则分层:将长期规则固化于AGENTS.md,任务特有约束写入Task Prompt 契约化任务:用"Goal/Context/Constraints/Acceptance"

文章图片
压缩3:OpenClaw上下文压缩方案、框架与算法详解

本文总结了OpenClaw平台中上下文压缩与预算管理的四层防御体系架构,主要解决长对话场景下LLM上下文窗口有限的问题。系统包含:1)底层提示缓存保留(Cache Retention);2)中层异步维护(Deferred Maintenance);3)上层上下文压缩(Compaction),通过分块摘要、历史裁剪等算法实现;4)顶层工具结果截断(Tool Result Truncation)。核心

文章图片
#算法
压缩3:OpenClaw上下文压缩方案、框架与算法详解

原理:当历史过长无法一次性摘要时,分块独立摘要,再合并。源自的思想。实现位置:[src/agents/compaction.ts](file:///workspace/src/agents/compaction.ts) 的(第 116 行),使用retryAsync重试(attempts: 3, minDelayMs: 500, maxDelayMs: 5000, jitter: 0.2)。关键函

文章图片
#算法
DeepSeek-V4-Pro模型配置解读

这是DeepSeek V4 超大规模稀疏 MoE 大模型384 个专家,每 token 激活 6 个1048576 超长上下文(YaRN 扩展)FP8 量化 + GQA 注意力,高效部署支持LoRA 微调 + 哈希检索增强属于当前开源顶尖的长文本大模型附(flash与pro对比):分类参数项小参数量:DeepSeek-V4-Flash大参数量:DeepSeek-V4-Pro差异说明🏷️ 模型基础

文章图片
#人工智能
19-Hugging Face Transformers之Qwen3.5-MoE 系列详解:混合专家 + 线性注意力 + 多模态的完整生命周期

Mermaid 渲染失败: Parse error on line 41:...生成: full_attention 层: KV Cachelinea...fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;输出文本模型位置编码嵌入融合视觉编码输

文章图片
#人工智能
18-Hugging Face Transformers之GPT-2 案例详解:Decoder-only 自回归模型的完整生命周期

本文以GPT-2为例,详细解析了Decoder-only自回归模型的全生命周期实现。GPT-2作为OpenAI发布的因果语言模型,采用自回归生成范式,使用因果掩码确保每个位置只能看到历史token。文章通过架构定位图展示了GPT-2在语言模型家族中的位置,并对比了其与LLaMA等模型的核心差异。重点剖析了GPT-2的特殊设计:Conv1D线性层(权重形状与标准nn.Linear相反)、Post-N

文章图片
#回归#数据挖掘
2026年06月10日全球AI前沿动态

2026年6月AI行业动态综述 全球AI领域近期迎来密集发展,呈现三大核心趋势:技术突破、智能体应用与硬件升级。技术层面,多模态大模型成为竞争焦点,苹果推出自研AFM模型并与谷歌Gemini深度整合,国内外厂商在轻量化、垂直领域持续突破,字节Lance、Next新程Alpha等开源模型表现亮眼。智能体生态快速成型,苹果Siri重构、微信AI开放平台及各类行业智能体推动AI向主动服务转型,结果分成等

#人工智能
2026年06月11日全球AI前沿动态

模型竞争进入白热化阶段,Anthropic与OpenAI形成双雄对峙格局,新模型不再单纯追求参数规模,而是聚焦工程落地、安全管控、垂直场景适配,安全分级(通用版/受限专业版)成为头部大模型的主流运营模式。AI技术全面跨界融合,大模型能力延伸至编程、生物、网安、影视、汽车、医疗等数十个领域,具身智能、多模态、智能体成为技术迭代核心方向,端侧部署、轻量化、高推理速度成为重要发展趋势。

#人工智能
    共 416 条
  • 1
  • 2
  • 3
  • 42
  • 请选择