
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
PaddleOCR-VL-1.6 (0.9B) 是 SOTA 级文档视觉语言模型 (VLM)。该模型以 96.3% 精度刷新 OmniDocBench v1.6,文本、公式、表格识别全面领先,并在古籍、生僻字、印章、图表等多场景能力显著增强,支持以 Markdown 和 JSON 格式输出结构化结果。官方支持一键部署多种硬件后端(NVIDIA GPU、昆仑芯 XPU、昇腾 NPU等)、无缝集成 D

PaddleOCR-VL-1.6 (0.9B) 是 SOTA 级文档视觉语言模型 (VLM)。该模型以 96.3% 精度刷新 OmniDocBench v1.6,文本、公式、表格识别全面领先,并在古籍、生僻字、印章、图表等多场景能力显著增强,支持以 Markdown 和 JSON 格式输出结构化结果。官方支持一键部署多种硬件后端(NVIDIA GPU、昆仑芯 XPU、昇腾 NPU等)、无缝集成 D

Claude Code,或者说 AI 智能体编程,聊一下个人的一些感受与心得。与 AI 智能体协作编程,可以说像是在航海,一起驶向计划的目的港。我虽是那个舵手,但能放手让 AI 来掌舵了。不过,难免偏航,不时需要人来纠正一下航向。我并没有甩手全权交给 AI,想来是几个方面吧:一是 AI 确实会偏航;二是我懂编程有能力驾驭;三是凭感觉、不那么激进。无论如何,个人用 AI 编程一直感受挺好。到目前的变

Rex-Omni 是一个 3B 参数多模态模型,它将视觉感知任务统一到一个“下一点预测”框架中。其支持的任务有:物体检测、OCR、指向、关键点定位、视觉提示。官方 README 有详细说明,包括各任务的示例。以下是个人的实践手记 ✌️准备 Conda 环境,准备 Rex-Omni,如遇 flash-attn 安装错误,推理代码,结果,Let’s Go Coding ~

从LLM的视角看,MCP/Skill提供的确实是一种高度优化的上下文描述,是提升其工具使用可靠性的关键输入。但从系统架构的视角一种标准化的、声明式的、可动态发现的、用于扩展和约束AI行为的能力接口规范。其核心价值在于实现安全、可靠、可扩展的人机与机机协作,而“优化描述”是实现这一目标的最关键技术手段之一。“优化描述”是MCP/Skill呈现给AI的“表象”和直接作用方式,而其“本质”是构建一个可扩

AI Agent, Skill 等开源好物的分享 ~

Claude Code,或者说 AI 智能体编程,聊一下个人的一些感受与心得。与 AI 智能体协作编程,可以说像是在航海,一起驶向计划的目的港。我虽是那个舵手,但能放手让 AI 来掌舵了。不过,难免偏航,不时需要人来纠正一下航向。我并没有甩手全权交给 AI,想来是几个方面吧:一是 AI 确实会偏航;二是我懂编程有能力驾驭;三是凭感觉、不那么激进。无论如何,个人用 AI 编程一直感受挺好。到目前的变

Claude Code 是一个 AI 编程助手,能够直接在你的代码环境中工作,通过终端、IDE 或网页帮你构建、调试和交付项目。一些有关安装、使用等的记录,分享一下 😊

Claude Code 之前分享了安装使用,这次呢,则是分享一下工作流。目前已有不少 AI Agent 工作流可以自主完成软件工程。本文是想分享怎么在 Claude Code 中使用它们,以及一个正在实践的、想博采众长的工作流。目前在实践的工作流结构,分为四个层次:定义 AI 行为准则,规范 Agent 行为。AI Agent 开发流程,两套“驾驶”方式,按需选择、并行开发。嗯,也可以让两套合作开

如果你现在想“玩起来”,建议基于 x86 主机搭建,买一块平价的 RVV 1.0 单板计算机,尝试用 Triton 写一个简单的向量加法或 GEMV,通过交叉编译并在板子上运行objdump观察其生成的vsetvli和vfmacc等 RVV 汇编指令。这是目前切入 RISC-V AI 编译器底层最直观的练手方式。








