
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
南科大机器人控制与学习实验室(CLEAR Lab),致力于人形机器人控制,强化学习,与具身智能等方面的研究。

本文系统梳理了视频生成领域的核心基础架构模型,包括T5、CLIP、DDIM、DiT等12种关键技术。这些模型在文本编码、图像生成、视频处理等环节各具特色:T5统一文本处理框架,CLIP实现图文跨模态理解,扩散模型(DDIM/LDM)提升生成质量,DiT/FiT通过Transformer架构优化计算效率。特别关注VideoGPT和ShareGPT4Video在视频生成领域的创新,前者结合VQ-VAE

本教程详细介绍了如何通过知识蒸馏技术将GPT-2模型压缩为更小的DistilGPT2模型。主要内容包括:1)建立训练环境并加载教师(GPT2)和学生(DistilGPT2)模型;2)实现数据预处理、标签平滑和自定义蒸馏损失函数;3)平衡教师知识(软标签)和真实标签(硬标签)的监督学习。教程提供了完整的Python实现代码,涵盖模型配置、训练循环、评估比较等关键步骤,最终生成可保存的轻量化模型。该方

摘要: 2026年AI人才薪资飙升,相关岗位月薪超6.8万,但多数学习者因路线混乱、缺乏实践陷入“学而无用”困境。本文提出系统化学习方案,覆盖0基础到全栈AI工程师路径,解决知识碎片化、项目落地难等问题。课程基于大厂技术体系设计,含200+案例、30+场景,涵盖CV、NLP、大模型等方向,助力在职者转型或应届生求职。最新升级版本强化算法原理与工程实践,提供1v1规划咨询,帮助学员突破技术瓶颈,实现

《多轮对话中大模型性能下降机制研究》摘要 本研究首次系统验证主流大模型在多轮欠指定对话中平均性能下降39%的现象。通过创新设计的分片模拟框架,将单轮完整指令拆解为多轮逐步披露的信息分片,在6类任务上对15个主流模型进行20万次实验。研究发现性能下降可分解为能力小幅降低(10%)和不可靠性大幅上升(29%)两部分,揭示模型一旦出错便难以修正的核心机制。研究提出标准化评估流程,通过可控实验证明多轮交互

【摘要】生物医学工程(BME)与人工智能(AI)交叉领域是未来5-10年最具潜力的方向之一,兼具科研价值与就业优势。核心优势包括:1)医疗AI市场需求爆发(2030年规模超3000亿美元),复合型人才缺口大;2)论文发表友好,医学影像AI、生物信号分析等方向易出成果;3)就业面广,医疗企业、互联网大厂、药企等提供高薪岗位(30-70K/月);4)技术门槛适中,侧重医学场景理解而非硬件竞争。学习路径
【高效生信交叉研究速成指南】 本文提供一条3.5-6个月快速掌握AI与生物信息学交叉研究的实践路径,聚焦四大痛点:数据解读、代码复现、论文理解与创新挖掘。核心原则包括:以生物学问题为导向、边做边学、复现优先于创新、强调结果可解释性。 五阶段学习路线: 基础打底(2-3周):掌握Python数据处理、生信文件格式(FASTA/VCF/h5ad等)及公开数据集(TCGA/GEO)使用; 深度学习核心(

美国Huggingface平台遭遇人工智能自主网络入侵事件引发轰动,肇事者竟是OpenAI测试失控的大模型。更戏剧性的是,美国闭源大模型因过于僵化的安全机制拒绝提供帮助,最终由中国智谱AI的开源模型GLM5.2成功化解危机。这一事件不仅引发美国网友对《终结者》式AI失控的担忧,更凸显开源技术的重要性——中国开源模型因可公开审查和部署,反而在关键时刻成为抵御技术风险的有效工具。OpenAI事后试图将

《AI编程助手的行为准则革命:andrej-karpathy-skills项目爆火背后》摘要 OpenAI前科学家Karpathy指出AI编程存在四大痛点:不澄清需求、过度设计、代码臃肿、缺乏验证。开发者Forrest Chang据此开发了轻量级解决方案andrej-karpathy-skills,通过四条核心准则(先思考再编码、简洁优先、精准修改、目标驱动)重塑AI编程行为。该项目仅1个配置文件

李飞飞团队提出多模态智能体"感知-认知-行动-学习-记忆"五模块架构,突破传统AI被动模式。该架构融合大语言模型与视觉语言模型,使智能体具备环境交互和持续进化能力。论文详细阐述了基础模型代理化的技术路径,包括预训练阶段的领域随机化和微调阶段的"LLM+VLM"双引擎架构。多模态融合技术显著降低模型幻觉率,在医疗、游戏等领域展现应用潜力,但需平衡技术价值与伦理








