logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Orca 的 AI Agent 编排架构:如何管理 35 种 AI 编码助手并行工作

Orca 是一个开源的下一代 IDE,定位为“AI 编排器”,通过统一启动管道并行管理 35+ 种第三方 AI 编码助手。其核心架构基于 intent 驱动的两阶段模式决策:先预判运行模式,再由执行主机确认,支持终端模式与结构化会话双模式。采用类型系统作为 agent 注册表,确保扩展性与编译期安全;通过解耦工作区创建与代理启动,实现执行隔离与容错,并在降级时记录原因,保障用户体验。

文章图片
#人工智能
JSONL 树形 session:append-only + 两种 fork

本文分析了 pi-mono 项目中的会话存储设计,采用树形结构而非线性列表存储对话记录。其核心特点包括:1)使用 append-only 的 JSONL 文件格式,每条记录包含唯一ID和父节点ID形成树状结构;2)通过独立的 leaf entry 标记当前活跃节点,支持精确回放历史状态;3)支持分支探索和并行对话路径。这种设计解决了线性存储的四大痛点:历史节点回放、分支并行处理、崩溃恢复和多端编辑

#人工智能
7天开发一个AI眼镜智能体:从0到1的踩坑实录 | GPASS百宝箱实战

本文记录了作者参加GPASS AI眼镜智能体开发者大赛的全过程,开发了一款名为"知面"的社交记忆助手应用。文章重点分享了技术选型、架构设计和实践中的关键问题解决方案。作者选择蚂蚁集团百宝箱平台,利用其低代码特性快速对接GPASS眼镜硬件能力,将功能划分为5个核心链路(记录、建档、识人、回忆、更新)。文中详细总结了6个典型技术难题及解决方案,包括持续监听模式处理、阿里云图片API调用优化、意图识别优

文章图片
#人工智能
大模型技术深入浅出--Attention

本文详解了Transformer中的注意力机制,包括三个核心部分:1)缩放点积注意力公式的运算步骤:相似度匹配、缩放、归一化和加权求和;2)Q、K、V向量的生成方式,通过输入X的线性变换获得;3)自回归生成过程中因果掩码和KV缓存的应用,以两步生成过程为例展示了注意力计算过程,并说明KV缓存如何优化推理效率。整个过程体现了Transformer如何动态计算注意力权重并有效利用历史信息。

文章图片
#深度学习#人工智能
大模型技术深入浅出--残差连接和层归一化

本文探讨了Transformer架构中的两个关键技术——残差连接和层归一化。残差连接通过将输入直接加到子层输出,缓解了深度网络的梯度消失和网络退化问题,为梯度传播提供了"捷径"。层归一化则通过标准化每层特征分布,解决了训练过程中的内部协变量偏移问题,提升训练稳定性。这两种技术协同工作:残差连接确保网络能够有效训练深层架构,而层归一化保证训练过程的快速收敛,共同构成了Transf

文章图片
#人工智能#深度学习#神经网络
大模型技术深入浅出--梯度下降

梯度下降算法通过不断调整模型参数来最小化损失函数。其核心公式中的减号确保参数始终朝下降方向更新,无论偏导数为正或负。学习率控制步长,过大可能导致震荡,过小则收敛缓慢。整个过程可类比下山:当前位置减去梯度方向的距离,迭代更新直至到达最低点(损失最小)。合理选择学习率对算法效率至关重要。

文章图片
#机器学习#人工智能
大模型技术深入浅出--hugging face的transformers对于Transformer架构的实现

本文深入解析了Transformer架构的核心组件及其实现细节。首先介绍了Transformer的数据流向,包括输入嵌入、位置编码和编码器-解码器结构。重点分析了自注意力机制(Self-Attention)的实现,包括QKV矩阵计算、缩放点积注意力和多头注意力。详细探讨了Dropout在Transformer中的关键作用,包括嵌入层和子层输出的正则化应用。文章还剖析了Add&Norm层的实

文章图片
#transformer#深度学习#人工智能
大模型的低成本应用--量化

摘要: 大模型量化通过将高精度浮点数(如FP32/FP16)转换为低精度表示(如Int8/Int4),显著减少显存占用、加速推理并降低能耗。主流方法包括: GPTQ:基于二阶误差最小化的逐层量化,适合GPU推理; AWQ:保护关键权重,量化次要权重,平衡精度与效率; Bitsandbytes:支持QLoRA微调,优化8/4位计算; GGUF:面向CPU的跨平台格式,支持灵活硬件卸载。 工具如ms-

文章图片
#AIGC#人工智能
大模型的低成本应用--PEFT(参数高效微调)

QLoRA(量化低秩自适应)是一种参数高效微调技术,通过4位NF4量化、双量化和分页优化器技术,显著降低大语言模型微调所需的显存。以Qwen3-14B模型为例,QLoRA将模型权重显存从112GB降至约7GB,同时保持性能接近全量微调。其核心优势在于:1)极低显存需求,使消费级GPU能微调百亿参数模型;2)通过LoRA适配器(约14M参数)大幅减少优化器状态显存;3)采用分页优化器技术避免OOM问

文章图片
#人工智能#python#算法
大模型中的FFN和Self-Attention

本文解析了Transformer架构中FFN层(前馈网络)和自注意力层的核心结构与功能。FFN层通过两个线性投影层和中间的非线性激活函数(如ReLU、GELU或SwiGLU)实现复杂的特征变换,是模型知识存储和获取非线性能力的关键。自注意力层则通过Q/K/V投影、非线性Softmax计算和输出聚合,实现上下文信息的提取与整合。研究表明,FFN层权重存储了模型的主要事实性知识,而Softmax函数为

文章图片
#人工智能#transformer#深度学习
    共 222 条
  • 1
  • 2
  • 3
  • 23
  • 请选择