logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

基于Qwen2.5-VL-7B-Instruct的Skills智能体开发平台

本文介绍了基于星图GPU平台自动化部署Qwen2.5-VL-7B-Instruct镜像,构建Skills智能体开发平台的方法。该平台简化了多模态模型的部署流程,支持快速开发文档分析等应用,能自动提取图像中的文本信息并生成结构化数据,提升智能体开发效率。

Qwen3-VL空间感知能力突破:实现2D接地与3D空间推理的AI新境界

Qwen3-VL实现了从图像识别到空间理解的跨越,具备2D定位与类3D推理能力,可精准解析UI布局、支持视觉代理操作,并在GUI自动化、文档结构还原和长视频检索中展现强大潜力,推动AI向具身智能迈进。

Qwen3-VL数字人开发:多模态交互系统部署案例

✅开箱即用:一键部署,降低入门门槛✅强大视觉理解:支持GUI识别、OCR、空间推理✅长上下文记忆:适合持续交互场景✅灵活集成:提供API接口,易于嵌入现有系统特别是其内置的模型,在保持较小体积的同时实现了接近大模型的推理能力,非常适合边缘侧或轻量级云端部署。

ChatGLM3-6B-128K实战案例:用Ollama处理整套Linux内核文档的智能检索

本文介绍了如何在星图GPU平台上自动化部署【ollama】ChatGLM3-6B-128K镜像,实现Linux内核文档的智能检索与跨模块知识关联。通过预处理内核RST文档并注入128K长上下文,开发者可自然语言提问,快速获取精准技术解答,显著提升内核开发与调试效率。

#Ollama
Tesseract OCR引擎详解与Java集成实战

OCR(Optical Character Recognition,光学字符识别)技术是一种将图像中的文字内容自动转换为可编辑文本的技术,广泛应用于文档数字化、自动化数据录入、智能表单识别等领域。随着深度学习的发展,OCR技术已从早期的模板匹配方式演进为基于卷积神经网络(CNN)和循环神经网络(RNN)的智能识别系统,显著提升了识别精度与多语言支持能力。在实际应用中,OCR技术被广泛用于银行票据识

寻音捉影·侠客行开源可部署:提供完整Dockerfile与K8s Helm Chart

本文介绍了如何在星图GPU平台上自动化部署🗡️ 寻音捉影 · 侠客行 (Shadow & Sound Hunter)镜像,实现高效的音频关键词检索。该工具基于阿里FunASR语音识别技术,能快速从长音频中定位用户设定的关键词,典型应用于快速提取会议录音中的关键信息,大幅提升信息处理效率。

#语音识别
SSM框架:Spring+SpringMVC+Mybatis综合详解与实践

SSM框架是Spring、SpringMVC和Mybatis三个框架的组合简称,其结合了这三个框架各自的优势,形成了一个功能强大、结构清晰、易于维护的Java EE全栈开发框架。SSM框架适用于多种类型的web应用程序开发,能够快速有效地处理数据的持久化、业务逻辑处理以及展示层的构建。MVC(Model-View-Controller)模式是现代Web开发中常用的一种架构模式,它将应用程序分为三个

MySQL JDBC驱动包5.1.46:Java数据库交互

本文还有配套的精品资源,点击获取简介:MySQL JDBC驱动包5.1.46是MySQL官方提供的用于Java应用程序与MySQL数据库通信的驱动程序。它包含必要的类和资源,使得通过Java执行SQL语句、管理数据库成为可能,对于Java Web开发尤为重要。本文介绍JDBC的定义、如何部署驱动包以及连接MySQL数据库的基本步骤。使用MySQL JDBC驱动5.1.46...

Java实战开发:键盘事件检测与处理详解

Java作为一门面向对象的编程语言,在图形用户界面(GUI)开发中广泛采用事件驱动编程模型。其核心在于通过事件源(如按钮、键盘、鼠标等)、事件对象(封装事件信息)和事件监听器(响应事件的处理逻辑)三者之间的协作,实现用户与界面的交互。这种模型使得程序结构清晰、模块化程度高,尤其适合响应外部输入行为。本章将从整体视角介绍Java事件处理机制的基本构成与工作原理,为后续深入学习键盘事件的检测与处理打下

Git-RSCLIP开源大模型部署指南:免配置镜像+Supervisor自动管理

本文介绍了如何在星图GPU平台上自动化部署Git-RSCLIP镜像,快速启用遥感图像-文本检索能力。无需配置环境或下载权重,用户可直接通过Web界面实现卫星影像的零样本分类与图文相似度分析,典型应用于国土监测、农业识别及灾害评估等遥感场景。

    共 701 条
  • 1
  • 2
  • 3
  • 71
  • 请选择