logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-OCR:用“一张图”压缩千言万语,让大模型记住更久的历史

视觉模态不仅是“看图说话”的工具,更是高效压缩语言信息的媒介。它挑战了“文本必须用文本 token 表示”的惯性思维,为解决 LLM 的长上下文瓶颈提供了全新视角。对话历史被“渲染”成滚动长图存入上下文;整本 PDF 以一张超图形式输入模型;LLM 的“记忆”像人眼一样——近处清晰,远处模糊,但整体高效。这不仅是 OCR 的进步,更是多模态与语言模型融合的一次范式跃迁。延伸阅读论文地址:[arXi

#计算机视觉#人工智能
从文本生成器到自主决策者:Agentic RL如何重塑大语言模型的智能边界

这篇综述的价值远超技术整合:它重新定义了LLM的能力边界。当我们不再将语言模型视为“更聪明的autocomplete”,而是嵌入物理/数字世界的决策主体时,AI的发展轨迹将发生根本性改变。Agentic RL的崛起预示着:下一代AI竞赛的焦点,将从“参数规模”转向“智能体能力”——谁能构建在复杂环境中持续学习、可靠决策的自主系统,谁将掌握AGI的钥匙。延伸思考:当LLM成为真正的智能体,我们是否需

文章图片
#语言模型#人工智能#自然语言处理
30分钟从零打造Python图形界面计算器:Tkinter实战教程(超详细)

对比项TkinterPyQtwxPython安装复杂度⭐(无需安装)⭐⭐⭐(需pip)⭐⭐(需pip)学习曲线⭐⭐⭐⭐⭐⭐⭐⭐⭐文档质量⭐⭐⭐⭐⭐⭐⭐⭐⭐适合场景快速原型/小工具大型应用跨平台应用本项目评分⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐关键结论对于第一个GUI项目,Tkinter是无可争议的最佳选择。它让你专注于编程逻辑而非环境配置,30分钟内就能获得可视化的成就感,这是持续学习的最大动力!最后赠言编程之美

#python#开发语言#github
零基础入门深度学习:从理论到实战,GitHub+开源资源全指南(2025最新版)

深度学习不是“看会的”,而是“练会的”。不要等“准备好了”再开始——今天就打开Colab,跑通第一个Notebook!“种一棵树最好的时间是十年前,其次是现在。” —— 非洲谚语。

#深度学习#github#开源 +1
2026年03月16日 AI 深度早报

👋 晨间导读今天是本年度 AI 圈最重磅的一天之一——NVIDIA GTC 2026 在圣何塞正式开幕,黄仁勋携 Feynman 1.6nm 新架构与 NemoClaw 开源 Agent 平台震撼登台,将 Physical AI 与具身智能推上新高度。与此同时,OpenAI 花 30 亿美元收购 Windsurf 的豪赌意外被微软截胡,暴露出 AI 编程赛道的内部角力;中国具身智能则在两个月内狂

文章图片
#人工智能#语言模型#自然语言处理 +1
基于LLM智能体框架的城市遥感图像变化分析

现有变化检测方法往往缺乏处理多样化现实查询的通用性,以及进行综合分析所需的智能化能力。本文提出了一种通用智能体框架——ChangeGPT,通过将大语言模型(LLM)与视觉基础模型(VFM)相结合,构建了一个层次化结构以抑制幻觉问题。该智能体在包含140个问题的精心标注数据集上进行了评估,这些问题按真实应用场景分类,涵盖多种问题类型(如:面积、类别、数量)及不同复杂度。评估维度包括:工具选择能力(精

#语言模型#人工智能#计算机视觉 +2
Earth-Agent:Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent 的三大贡献:1. 首个 MCP 架构的 EO Agent 框架├── 104 个专业地学工具(5大类)├── ReAct 推理循环├── 支持 RGB + Spectrum + Products 三模态└── 基于 MCP 协议,易于扩展2. Earth-Bench 专业评估基准├── 248 道专家级问题 + 13,729 张图像├── 三种数据模态(RGB / Spec

文章图片
#语言模型#人工智能
RS-Claw & XSkill 深度分析

Figure 1: 左右对比。Baseline agent因visual-semantic gap失败(忽视倒置图像、未隔离小目标);XSkill检索相关经验和技能,生成视觉感知修正→裁剪→识别的正确执行计划。Skills (技能) = 结构化任务级指导定义: k = (ℳ, 𝒲, 𝒫) → 元数据 + 工作流序列 + 可复用工具模板存储: 结构化Markdown文档作用: 提供plannin

文章图片
#腾讯云#云计算#人工智能 +1
论文深度分析: MMSkills & Visual Skills

branch-loaded MMSkills将技能证据与实时屏幕对齐,返回状态感知的指导。(A) 动作分布: MMSkills让click-heavy agent转为更多结构化输入;右边: Branch-loaded agent在临时分支中检查技能证据后返回结构化指导。传统做法: 直接将技能注入main context → 图像+状态卡造成context压力,且可能让agent锚定在参考截图而非实

文章图片
#腾讯云#云计算#人工智能 +1
论文深度分析: MMSkills & Visual Skills

branch-loaded MMSkills将技能证据与实时屏幕对齐,返回状态感知的指导。(A) 动作分布: MMSkills让click-heavy agent转为更多结构化输入;右边: Branch-loaded agent在临时分支中检查技能证据后返回结构化指导。传统做法: 直接将技能注入main context → 图像+状态卡造成context压力,且可能让agent锚定在参考截图而非实

文章图片
#腾讯云#云计算#人工智能 +1
    共 43 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择