
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
基于视觉-语言预训练框架的系统,如 OpenAI 推出的 GPT-4V(Vision 版本),以及 Google 的 Gemini 系列,都展示了在文档理解、表格解析、复杂版式分析方面的强大能力。不同于传统的级联式 OCR 模型(检测 + 识别),LightOnOCR-2-1B 强调端到端处理能力,能够直接将像素映射为结构化文本,支持多语言识别以及表格、公式等结构化内容的提取。此外,在保持 0.9

本文介绍了5个公共数据集和5个AI相关教程资源。数据集包括遥感图像、智能体推理、文档解析、记忆压缩和食品检测等专业领域,涵盖多模态数据和应用场景。教程资源覆盖神经网络构建、视频目标跟踪、大模型应用、图像生成和扩散模型等热门AI技术,提供从基础到进阶的学习路径。

该模型采用 Looped Transformer(循环 Transformer) 架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与

OpenAI 终于再度发布开源大模型——gpt-oss-120b 和 gpt-oss-20b,前者以千亿级参数专为复杂推理与知识密集型场景设计,后者则更适合低延迟、本地或专业垂直领域使用

针对小模型复杂任务处理能力不足的问题,Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,一款基于 Qwen3.5-9B 打造的推理增强语言模型。相比基础模型 Qwen3.5-9B,Qwythos 在多个评测中实现显著提升,其中 MMLU 提升 34 分,gsm8k-strict 数学推理提升 30 分,证明了小参数模型同样能通过高质量推理数据实现能力跃升。如何让更小

Nemotron-SFT-SWE-v3 是由 NVIDIA 于 2026 年发布的一个软件工程指令微调数据集,旨在提升大语言模型在 SWE-Bench 风格任务中的代码理解与修复能力。Open-SWE-Traces 是由 NVIDIA 于 2026 年发布的一个面向大语言模型智能体指令微调的数据集,旨在提升模型在软件工程领域的代码修复与多步工具调用能力,广泛应用于代码智能体训练、自动化软件修复系统

FDAbench-Full 数据集是一个用于评估数据代理(Data Agents)在异构数据分析任务中的表现的综合基准,包含 2,007 个高质量分析任务,覆盖不同数据领域、难度等级与任务类型,用于系统考察模型在数据库查询生成、SQL 理解以及金融数据分析中的能力。AutoDock-GPU_Output 数据集是一组由 AutoDock-GPU 生成的标准对接输出文件(.dlg),包含结合能、构象

VibeVoice-Realtime TTS 采用一种新颖的次令牌扩散方法,用于在长篇多说话者语音合成中建模连续数据,并引入高效的连续语音分词器,使模型能够在 64K 上下文窗口内生成长达 90 分钟的语音,最多支持 4 名说话者,同时在保持音频忠实度的前提下大幅提升计算效率,捕捉真实对话氛围。该数据集共包含 600 条测试样本,每条样本都包含完整的输入信息与元数据,包括唯一标识、图像或文本输入、

通过在流式推理过程中复用历史上下文的中间状态,实现对连续音频流的高效处理,保持识别精度的同时显著降低了端到端延迟,支持在推理阶段动态选择不同的延迟与精度权衡点。Fun-ASR-Nano 是由阿里巴巴通义实验室推出的面向低算力部署的端到端大模型 ASR 方案:由 Transformer 音频编码器、连接编码器与 LLM 的 音频适配器、用于生成初始假设的 CTC 解码器,以及最终输出文本的 LLM

DeepSeek-OCR2突破传统OCR局限,采用LLM风格的DeepEncoderV2架构,通过语义驱动式视觉token重排实现更自然的文档理解。该模型以Qwen2-0.5B替代CLIP编码器,引入因果流查询机制,支持256-1120个视觉token的多裁剪策略,在OmniDocBenchv1.5基准测试中取得91.09%准确率,较前代提升3.73%








