
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
总参 1.6T,激活 49B:总参 284B,激活 13B两款都吃 100 万 token 上下文Instruct 版走 FP4 + FP8 混合精度,base 全 FP8全部 MoE 架构数字猛归猛。但 1.6T 不是这次的看点——上半年 1T 级的开源 MoE 已经不止一家。

这篇讲的,是 Anthropic 内部已经有人验证过的用法。你的场景不一定和他们一样。试完之后会碰到这类工具在你具体场景里能做什么、做不到什么——那是下一步的事。第一步是:先看见这类工具在真实场景里用起来是什么样的,知道入场点在哪里。先别急着学工具。回头看看你这一周做过的活,哪一件是反复在重复的——那很可能就是你的第一张任务卡。如果你还不知道该怎么上手 Claude Code 和 Codex,这个

总参 1.6T,激活 49B:总参 284B,激活 13B两款都吃 100 万 token 上下文Instruct 版走 FP4 + FP8 混合精度,base 全 FP8全部 MoE 架构数字猛归猛。但 1.6T 不是这次的看点——上半年 1T 级的开源 MoE 已经不止一家。

Browser-Use是一个Python工具,让大模型能与真实浏览器交互,实现网页自动化操作。它支持原生浏览器控制、与大模型深度集成,具有模块化设计特性。主要应用场景包括智能广告生成、QA测试和新闻监控等。安装简单,支持虚拟环境和MCP服务器模式,可快速构建定制化应用。通过结合大模型能力,Browser-Use扩展了AI在Web环境中的实际应用。

DeepSeek-OCR是一款突破性的开源OCR模型,通过创新性的视觉语义压缩,具备3B参数量却能在A100单卡实现2500 tokens/s的推理速度。作为OCR 2.0代表,它不仅能识别文字,还能理解文档结构、解析图表表格、生成图片描述,并支持目标检测和Markdown转换。其核心创新是"上下文光学压缩"技术,通过视觉语义压缩显著减少视觉token数量,实现最高20倍压缩比

在数据驱动的时代,文档早已不只是文字。本文将带你从零搭建一个 DeepSeek-OCR 驱动的多模态数据分析 Agent,实现从 PDF → 结构化数据 → 可视化大屏 的一键自动化流程。我们将结合 DeepSeek-OCR + vLLM 推理加速 + LangChain 1.0 工作流编排,彻底打通 “图像识别 → 文本解析 → 指标抽取 → 交互式报告生成” 的全链路,助你高效解析财报、科研论

LangChain 1.0 Agent开发摘要 LangChain 1.0引入了革命性的create_agent()API,将Agent从简单的模型调用器升级为具备决策与执行能力的智能运行体。新版本通过统一API接口简化了开发流程,取代了0.x时代的碎片化设计。核心优势包括: LangGraph驱动:底层采用LangGraph作为执行引擎,使Agent具备生命周期管理和节点化执行能力 三大核心组件

TEN框架是一个开源的实时多模态交互框架,专注于低延时语音对话体验。它支持语音、视频、图像和文本的智能体开发,具有插件化、跨语言和可视化编排等特性。框架通过流式处理、并行执行和零拷贝技术实现百毫秒级响应,内置VAD和打断功能确保自然对话体验。应用场景涵盖智能家居、同声传译、虚拟形象等。开发者可通过简单示例快速构建实时语音助手,支持多平台部署和边云协同。TEN框架降低了构建"能听会说&qu

本篇文章系统梳理了企业级常用的三类多模态 OCR 工具 —— MinerU、PaddleOCR-VL、DeepSeek-OCR,并从场景适配角度分析了它们各自的技术侧重点与应用价值。文章以实战为导向,展示如何将三大 OCR 解析引擎通过 vLLM 推理框架部署为独立服务,并进一步构建一个可统一调用的多模态解析系统

本文对比评测了三款主流OCR工具(MinerU、PaddleOCR、DeepSeek-OCR)的技术架构与性能表现。测试显示,DeepSeek-OCR在复杂文档识别准确率(97%)和处理速度(100页/8分钟)领先,PaddleOCR轻量化优势突出(国产硬件支持),MinerU擅长干扰信息过滤。文章还提出基于vLLM框架的多模态数据分析系统方案,整合三款OCR工具的优势功能,并计划开源该系统实现本







