
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
LeReT[1] 是一个基于强化学习的框架,旨在增强 LLM 的检索能力,使其生成的答案更加可靠。通过将答案建立在人类生成和验证的数据之上,LeReT 成功地将检索准确率提高了 29%,下游生成评估提升了 17%。简单来说,其原理就是通过不断尝试和优化查询,使 LLM 能够更准确地检索到相关信息,从而减少幻觉现象。该框架具有高度的灵活性,它将检索视为一个黑盒,这意味着通用算法适用于任何工具和奖励函

强化学习(RL)已经成为当今 LLM 不可或缺的技术之一。从大模型对齐到推理模型训练再到如今的智能体强化学习(Agentic RL),你几乎能在当今 AI 领域的每个领域看到强化学习的身影。

SFT中文释义为:一种通过监督学习进行模型微调的方法。``RLHF的释义为:一种利用人类反馈进行强化学习的方法,该方法通过收集人类对模型输出的反馈;然后使用这些反馈来优化模型的行为。说白了,不论是SFT还是RLHF的目的只有一个,那就是让模型变得更好。SFT——监督微调_监督微调的原理很简单,就类似于学生上学,不论题目做的是对是错,老是都会告诉你一个正确的结果,也就是答案。监

我们提出一种解释性方法(re-distillation, 重蒸镏),用1K样本SFT可达到与R1-style RL相同的泛化性能,而后者采样次数超过100K。可压缩性质说明RL并非天然具有内在的泛化性优势,SFT也并非天然缺乏泛化能力。

Moonshot AI是一家专注于通用人工智能领域的创新型企业,其核心产品Kimi智能助手搭载了先进的语言模型——moonshot-v1。该模型专门训练用于处理和理解自然语言及书面语言,能够根据用户的输入生成相应的文本输出。moonshot-v1的应用范围极为广泛,包括但不限于内容创作、代码生成、文本摘要、对话系统以及创意写作等。

今天我们讲两个方面的内容,使用大模型进行标书写作的一个简单开源项目,以及再看openai O1进展及LLM-Self-Correction机制。

在当今科技驱动发展的时代,**电子信息类、计算机类、自动化类、电气类和机械类**5大工科类专业,因其就业前景广阔、行业需求旺盛而备受关注。不管是高考志愿填报,还是大学专业分流,都是热门方向。

知识图谱(KGs)已经可以很好地将海量的复杂信息整理成结构化的、机器可读的知识,但目前的构建方法仍需要由领域专家预先创建模式,这限制了KGs的可扩展性、适应性和领域覆盖范围。

随着企业数字化转型的加速,数据管理和分析变得越来越重要。传统的指标管理平台虽然已经能够帮助企业有效地收集、计算、管理和展示关键指标,但在业务分析层面,面对日益复杂的数据环境和业务需求,单纯依靠人工分析已经难以满足高效、精准的管理要求。为此,将指标管理平台与AI大模型相结合,成为了一种新的趋势。本文将,探讨如何通过AI+的融合,实现指标检索、指标趋势查看、指标数据查询和指标归因分析等应用场景,助力企

摘要:智能体被定义为能够感知环境、做出决策并采取行动的人工实体。受汽车工程师协会(SAE)自动驾驶六级分类的启发,智能体也根据其功能和能力被划分为以下层级:L0——无 AI,具备工具(有感知能力)和行动;L1——使用基于规则的 AI;L2——用基于模仿学习(IL)/强化学习(RL)的 AI 替代基于规则的 AI,增加推理和决策能力;L3——应用基于大型语言模型(LLM)的AI 替代基于 IL/RL








