
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
简单来说,TransformerEncoderLayer和DecoderOnly的大模型用的TransformerEncoder都是过完self MHA后过FFN(但有如下列的若干区别,mask当然首当其冲);TransformerDecoder比TransformerEncoder多了cross MHA,当然mask也有较大的变化。
dice loss 来自文章VNet(V-Net: Fully Convolutional Neural Networks for Volumetric Medical Image Segmentation),旨在应对语义分割中正负样本强烈不平衡的场景。本文通过理论推导和实验验证的方式对dice loss进行解析,帮助大家去更好的理解和使用。dice loss 定义dice loss 来自 dic
完整语音输入系统,Push-to-talk模式,音频通过WebSocket流式传输至私有STT端点,支持macOS CoreAudio、Linux ALSA原生捕获,回退至SoX;通过Anthropic API同步配置与记忆,基于时间戳的last-write-wins策略,搭配本地缓存与增量同步,解决冲突问题。的agent团队系统,每个teammate对应JSON邮箱文件,通过读写邮箱通信,文件锁
摘要:ARPO(Agentic Reinforced Policy Optimization)提出基于熵的自适应强化学习框架,优化工具调用策略。 关键创新: 熵自适应机制:在工具调用后检测token熵变化,动态调整rollout数量(高熵时增加采样,低熵时减少),提升效率; 优势估计优化:针对轨迹中的共享片段和分支路径,设计硬/软优势估计方法,前者区分计算共享与分支优势,后者通过重要性权重统一处理

论文给出了定理证明:在归纳头(Anthropic 2022的研究)这个分析框架下,对齐NTP目标的快权重更新,在期望意义上能明确提升正确下一个token的logit,而原来的重建目标对正确token在统计上没有帮助。由于 KV-Cache 恒定在 8 k,推理复杂度严格 O(N),且无需额外向量或外部存储,同时从自回归视角看,它把长上下文似然拆成 T 个短上下文似然的乘积,因此可复用现成 8 k

保持图文原始顺序与语义关联将图像有效转化为 LLM 可处理的 token 序列确保训练数据的图文一致性与多样性这类数据是通向通用多模态智能(如能读图写文、看图说话、图文推理)的基础,也是当前 MLLM 前沿研究的重点方向。

来自https://arxiv.org/pdf/2511.22570,个人感觉贡献远没有提出GRPO的DeepSeekMath大。简单来说思路就是Reward Model一部分输入从自己整一个meta_verification,一个GRPO过程变成了2个GRPO过程,通过meta_verification验证证明的过程对不对,这非常符合人类证明的过程。

# SphereFaceclass SphereProduct(nn.Module):r"""Implement of large margin cosine distance: :Args:in_features: size of each input sampleout_features: size of each output samplem: marginc...

光流的概念(Optical Flow)光流是空间运动物体在观察成像平面上的像素运动的瞬时速度,是利用图像序列中像素在时间域上的变化以及相邻帧之间的相关性来找到上一帧跟当前帧之间存在的对应关系,从而计算出相邻帧之间物体的运动信息的一种方法。一般而言,光流是由于场景中前景目标本身的移动、相机的运动,或者两者的共同运动所产生的。考虑下图(图片来自维基百科):图中表示一个小球在连续5帧图像中的移动,箭头则
1、简介和比较Mosaic数据增强方法是YOLOV4论文中提出来的,主要思想是将四张图片进行随机裁剪,再拼接到一张图上作为训练数据。这样做的好处是丰富了图片的背景,并且四张图片拼接在一起变相地提高了batch_size,在进行batch normalization的时候也会计算四张图片,所以对本身batch_size不是很依赖,单块GPU就可以训练YOLOV4。https://github.com







