
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【大模型LLM学习】天池Deep Research Agent开发赛
【代码】【大模型LLM学习】天池Deep Research Agent开发赛。

【大模型LLM学习】Agentic RL—基于Qwen3-4b的Deep Search Agent
记录训练本地的deep search agent过程
【大模型LLM学习】AutoResearch——AFAC 2026赛题三实践
今年天池AFAC的赛题三是Auto Research问题,要求实现一个Agent,让这个Agent自动的写代码、做实验、根据准确率反馈自己调整,包括2个数据集,对于每个数据集任务,有在1张4090显卡上总共2个小时运行的时间跑出测试集结果提交。两个具体子任务:( 1 )产品分类任务:以图节点分类的形式进行评测;( 2 )产品推荐任务:在用户 - 产品的二部图上的图链接预测问题。

【大模型LLM学习】Agentic RL—基于Qwen3-4b训练Travel Planning Agent
AgenticRL第二篇,旅行规划小助手

【多模态】qwen3-vl的强化微调
基于ms-swift强化微调qwen3-vl

【多模态】swift框架使用qwen2-vl
前几篇里面学习了常见的一些多模态模型的典型架构和源代码,上一篇里面测试使用了minicpm-v系列模型,在尝试RLHF的时候发现swift特别好用特别全,记录一下对swift的一些使用,欢迎批评指正~前一篇里面写了minicpm-v的使用方法,这里主要记录qwen2-vl的使用。

【多模态】qwen2-vl模型代码技术学习
qwen2-vl的学习记录

【大模型LLM学习】从强化学习到GRPO【下】
从强化学习学到GRPO,这篇笔记就够了

【大模型LLM学习】Agentic RL—基于Qwen3-4b训练Travel Planning Agent
AgenticRL第二篇,旅行规划小助手

【大模型LLM学习】Agentic RL—基于Qwen3-4b的Deep Search Agent
记录训练本地的deep search agent过程







