
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
RAG(Retrieval-Augmented Generation)即检索增强生成,为 LLM 提供了从某些数据源检索到的信息,并基于此修正生成的答案。RAG 基本上是 Search + LLM 提示,可以通过大模型回答查询,并将搜索算法所找到的信息作为大模型的上下文。查询和检索到的上下文都会被注入到发送到 LLM 的提示语中。RAG技术是一种结合了检索和生成能力的机器学习架构,它在大型语言模型
LangChain 是一个开源的编程框架,用于简化使用大语言模型(LLM)构建应用程序的过程,通过模块化组件(如数据连接、代理系统和任务编排)实现与外部数据源和计算工具的集成,简化智能应用的构建过程。目前,它提供了 Python 和 JavaScript(确切地说是 TypeScript)的软件包。本质:基于大型语言模型(如GPT-4)的开发框架,提供标准化接口和工具链,降低构建AI应用的技
1.语言模型LLM· 定义:在超大规模文本数据上训练,以理解和生成自然语言为核心目标的模型。· 本质: “文本专家”。它将世界知识、逻辑和任务抽象为符号(语言)进行处理。· 输入/输出: 文本 ——文本。· 例子: GPT-4(纯文本版)、Llama、Claude。2.视觉语言模型VLM· 定义:在图像-文本对数据上训练,能够同时理解视觉内容和语言,并在两者间建立联系的模型。· 本质: “视觉翻译
。机器人仿真通过物理引擎和传感器模拟构建虚拟环境,允许机器人在无风险条件下进行大量试错训练。例如,加州大学伯克利分校与NVIDIA合作的框架中,双手机器人通过仿真训练实现了98.7%的跨模态操作成功率。强化学习通过奖励机制和策略优化,使机器人在仿真中学习复杂操作。清华大学的RLinf-VLA框架支持多样化模型(如OpenVLA和OpenVLA-OFT),结合LoRA技术降低计算成本,实现动作
相关滤波模型:属于判别式模型,相关滤波之前,所有的跟踪都是在时域上进行,涉及复杂的矩阵求逆计算,速度慢。它通过一组带权重的粒子来表示目标状态的概率分布,并根据观测数据更新粒子的权重和位置,从而实现对目标的跟踪。相关滤波(Correlation Filter)算法:相关滤波算法通过训练一个滤波器,使得滤波器与目标模板的响应最大,从而实现对目标的跟踪。在序列的初始帧中,目标的位置和特征需要被明确。目
偏导数是指在多元函数中,对其中一个变量求导,而将其余变量视为常数的导数。在神经网络中,偏导数用于量化损失函数相对于模型参数(如权重和偏置)的变化率。
人体姿态估计(Human Pose Estimation, HPE) 是指通过计算机视觉技术来推测或估计人体在三维空间中的姿态信息,包括关节位置、角度和身体姿势等。本质上,它是一种捕获每个关节(手臂、头部、躯干等)的一组坐标的方法,该坐标被称为可以描述人的姿势的关键点(keypoint)。目前主流的人体姿态估计算法可以划分为传统方法和基于深度学习的方法。
该数据集包含50个城市不同场景、不同背景、不同街景,以及30类涵盖地面、建筑、交通标志、自然、天空、人和车辆等的物体标注,共有5000张精细标注的图像和2万张粗略标注的图像。目标检测则是计算机视觉中的另一项重要任务,它的主要目标是识别图像或视频中存在的物体,并给出这些物体的位置和边界。VOC数据集是计算机视觉主流数据集之一,由牛津大学、比利时鲁汶大学等高校的视觉研究组联合发布,可以用作分类,分割,
动作识别是计算机视觉中的一个重要任务,旨在从视频或序列数据中识别和分类人类的动作或行为。它不仅仅是检测场景中是否存在人或物体,更关注于解析这些主体在做什么,例如区分走路、跑步、挥手或摔倒等具体动作。该技术的核心在于从视频的时空维度中提取特征。视频由一系列按时间顺序排列的帧组成,动作识别需要同时学习空间特征(如物体或人体的外观)和时间特征(如运动的变化规律),从而构建出完整的时空特征表示。实现方
在人工智能领域,特别是涉及对话代理(Conversational Agents, CAIs)和情感代理(Affective Agents)时,“Agent的Personality”指的是赋予人工智能代理的一组稳定、可预测的心理特征和行为模式,使其表现得更像一个具有独特个性的个体,而非冰冷的程序。在AI Agent的语境中,“Group”(组)通常指的是一种组织多个智能体(Agent)进行协作的机制







