logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

llama3论文阅读

稠密Transformer(Dense Transformer)是指传统的Transformer模型,其中所有的注意力头和前馈网络层都是稠密的,即每个输入位置都会参与到每个输出位置的计算中。MOE架构的一个著名变体是稀疏门控MOE(Sparse Gated Mixture of Experts),它在Google的Switch Transformer模型中得到了应用,该模型通过使用稀疏门控机制来减

文章图片
#论文阅读
gpt2Tokenizer

nn.Embedding,根据字符对应的序号取,是可训练的Token是大模型的原子,一切都以标记为单位,与标记有关,不要忽略它!!非英语语言表现较差,英语比非英语多得多训练数据,得到更长的优质tokengpt2写python不利,太多缩进,gpt2把空格都当成了token同样的文本,gpt4的token数量比gpt2少一半,这是因为其token数量是gpt2的两倍,但这并不是好事,这意味着embe

文章图片
#人工智能#深度学习
Flow-GRPO vs Flow-Factory: SD3 GRPO 实现对比

Flow-Factory 是 flow_grpo 的全面工程化重构维度flow_grpo代码组织单文件内联多层抽象解耦模型扩展每模型复制脚本实现 Adapter 即可算法扩展每算法复制脚本继承 Trainer 即可动力学扩展修改 SDE 函数Scheduler 多态配置管理分布式通信手动 gather/scatter通信感知 AdvantageProcessor内存效率存储所有 timestept

#人工智能#算法
爬虫5:xpath

某些网站的反爬手段是检查你从哪个页面进来的,这时就要加入referer信息。对于需要登录的网站来说,cookie是个很好的选择。还有可能进行封ip操作,这时我们可以使用代理。一些常用方法,敲敲就明白了。爬取猪八戒招聘网站信息。

文章图片
#爬虫
到底了