logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

视觉语言模型(VLM)从入门到精通

*视觉语言模型(Vision Language Model, VLM)**是一类能够同时处理视觉信息(图像、视频)和文本信息,并在两种模态之间建立深度语义关联的人工智能模型。核心本质:VLM通过在共享的语义嵌入空间中对齐视觉特征和语言表示,实现"看图说话"、"听文生图"的跨模态理解与生成能力。理解图像内容并用自然语言描述遵循涉及视觉的复杂文本指令推理跨越视觉和语言的多模态信息泛化到训练时从未见过的

文章图片
#语言模型#人工智能#计算机视觉 +2
如何在Cursor中配置chrome-devtools-mcp工具

Cursor (MCP, Model Context Protocol) => chrome-devtools-mcp server (npx) => Chrome Devtools Protocol (CDP) => 浏览器chrome-devtools-mcp 是一个 MCP Server,通过 Chrome DevTools Protocol (CDP) 桥接 AI Agent 与 Chro

文章图片
#人工智能#深度学习#机器学习 +2
如何在Cursor中配置chrome-devtools-mcp工具

Cursor (MCP, Model Context Protocol) => chrome-devtools-mcp server (npx) => Chrome Devtools Protocol (CDP) => 浏览器chrome-devtools-mcp 是一个 MCP Server,通过 Chrome DevTools Protocol (CDP) 桥接 AI Agent 与 Chro

文章图片
#人工智能#深度学习#机器学习 +2
OpenClaw——windows保姆级安装教程【零基础小白也能操作】

Git是代码版本管理工具,OpenClaw 在安装过程中需要用它从网上下载一些依赖包,跟node.js一样,它只是openclaw的一个内置依赖工具,只需要安装它就行,不需要搞懂它是干嘛的。这里有很多模型,作者推荐新手先使用qwen,因为它支持OAuth授权登录,可以直接在网页上登录账号进行认证,而且qwen有免费额度,方便快速上手使用。接着程序会推荐一些技能包,建议至少添加ClawHub,这是官

文章图片
#人工智能#深度学习#神经网络 +2
大模型内核全解析:一文搞懂 LLM、MCP 与 Agent 的关系

LLM(Large Language Model,大语言模型)是一种基于深度学习技术训练的人工智能模型,能够理解和生成人类语言。大规模参数:从数十亿到数万亿不等(如 GPT-4 估计有 1.8 万亿参数)海量数据训练:在数万亿 token 的文本数据上进行预训练涌现能力:当规模达到一定程度,模型会展现出小模型不具备的能力(如推理、代码生成)MCP(Model Context Protocol,模型

文章图片
#人工智能#深度学习#神经网络 +2
OpenClaw——windows保姆级安装教程【零基础小白也能操作】

Git是代码版本管理工具,OpenClaw 在安装过程中需要用它从网上下载一些依赖包,跟node.js一样,它只是openclaw的一个内置依赖工具,只需要安装它就行,不需要搞懂它是干嘛的。这里有很多模型,作者推荐新手先使用qwen,因为它支持OAuth授权登录,可以直接在网页上登录账号进行认证,而且qwen有免费额度,方便快速上手使用。接着程序会推荐一些技能包,建议至少添加ClawHub,这是官

文章图片
#人工智能#深度学习#神经网络 +2
到底了