
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文详细介绍了Flux LoRA模型的完整训练流程,包括数据集准备(10-30张高质量图像)、环境搭建(ComfyUI+依赖库)、训练参数配置及测试调优技巧。同时解析了Flux模型采用Transformer架构(MM-DiT)相比U-Net的优势,以及CLIP与T5编码器的协同工作机制。一、准备阶段最少 10–20 张图像,高质量、多角度、多场景,可考虑最多不超过 30 张,过多会导致 LoRA

论文(The Landscape of Agentic Reinforcement Learning for LLMs: A Survey)绘制了大语言模型agent强化学习的全景图,展示了模型如何通过跨时间步骤的行动来学习。该综述涵盖了500多项工作,将其组织成一个包含能力和应用两部分的完整地图。问题背景:传统大语言模型训练存在根本缺陷:仅对单个回答进行一次奖励,然后停止学习。但现实任务需要:•

本文详细介绍了大模型训练全流程,包括预训练、继续预训练、指令微调(SFT)、偏好对齐(DPO/ORPO/KTO)和强化学习对齐(PPO)。提供了基于Hugging Face/TRL/PEFT和ms-swift的代码实现,介绍了LoRA/QLoRA技术、数据格式与chat模板使用,以及评测部署方法。以Qwen模型为例,适用于其他大模型,适合不同GPU配置的学习者参考。说明。

现在的多模态大模型,已经能帮我们搞定,“看图答题”,“多模态创作”,以及“行业质检”等问题;未来它还会融入更多模态——比如说结合“触觉数据”(类似于机器人抓握物体时的力度),“生物信号”(就如同心率、脑电波那样),在康复医疗、智能家居等领域发挥出更大的作用。对于普通用户而言,无需纠结于技术方面的细节,只需牢记“按需选择”即可。在日常创作时,可选择GPT-4V、文心一言4.0这类,“较为轻便且易于使

识别出更新幅度排序的前。

文章介绍了AI Agent概念的演变,从前大模型时代的定义(强调环境交互、智能、感知等特性)到大模型时代基于LLM的Agent三组件(规划、记忆、工具使用)。文章解析了Agent与大模型的关系(AI Agent = LLM + 角色定义 + 规划 + 工具使用 + 记忆),探讨了为什么需要Agent(解决环境隔离、执行能力、任务拆解和状态维持问题),并预告了后续将实现数据洞察Agent的实践内容。

投机解码通过“草稿 + 批改”的策略,在不牺牲生成质量的前提下显著提升推理效率。如何在预测精度与延迟之间找到最佳平衡?如何与批量推理结合?是否能推广到多模态等更复杂场景?这些问题为未来研究留下了空间,也让投机解码成为大模型推理优化的一个重要方向。论文链接:https://arxiv.org/pdf/2401.07851。

对人类水平人工智能(AI)的追求显著推动了自主智能体和大型语言模型(LLM)的发展。LLM现在被广泛用作决策智能体,因为它们能够解释指令、管理顺序任务并通过反馈进行适应。本综述旨在审视LLM作为自主智能体和工具使用者方面的最新进展,并涵盖七个研究问题。我们仅使用了2023年至2025年间在A*和A级会议以及Q1期刊上发表的论文。本综述对LLM智能体的架构设计原则进行了结构化分析,将其应用分为单智能

尽管全量微调可以深度改造模型能力,但需消耗大量算力且有一定技术门槛。在绝大多数场景中,若只想提升模型某个具体领域的能力,高效微调会更加合适,而目前适用于大模型的最主流高效微调方法是 LoRA。在入手学习大模型微调时,首先推荐功能层次封装层次较高的微调四套工具:unsloth、LlamaFactory、ms-SWIFT 和 ColossalAI。除此之外,也可以借助更加底层的库,如 peft、LoR

本文基于 Spring AI 框架,完整实现了一套企业级 RAG 系统,从技术选型、依赖配置到核心服务代码,提供了可直接落地的解决方案。该系统通过 Spring AI 简化了大模型与向量存储的集成,通过 Apache Tika 与 LangChain4j 解决了多格式文档处理与分块优化问题,最终实现了 “文档入库 - 问题检索 - 增强生成” 的全流程自动化。基于私有知识库生成回答,避免幻觉支持动








