logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化文字渲染与海报排版:百度开源文生图模型 ERNIE-Image-Turbo;告别大模型「遗忘」:微软 OpenMementos 上下文压缩训练数据集上线

本文介绍了5个公共数据集和5个AI相关教程资源。数据集包括遥感图像、智能体推理、文档解析、记忆压缩和食品检测等专业领域,涵盖多模态数据和应用场景。教程资源覆盖神经网络构建、视频目标跟踪、大模型应用、图像生成和扩散模型等热门AI技术,提供从基础到进阶的学习路径。

文章图片
#百度#开源#深度学习 +2
教程上新丨强化学习仿真实操:Legged Gym 框架结构及奖励函数设计思路

摘要:LeggedGym 是基于 IsaacGym 开发的强化学习仿真框架,通过深度封装 PPO 等算法大幅降低腿足机器人控制开发门槛。该框架支持7类机器人控制任务,包括四足机器狗(A1 / Anymal 系列)在平地和粗糙地形的步态生成、双足机器人(Cassie / PF2)行走等高难度任务,开发者只需专注奖励函数设计即可快速验证算法。

文章图片
#机器人#算法#仿真
GLM-4.7-Flash:高性能、高吞吐轻量化的 MoE 推理模型;Delhi Pollution AQl:超过二十万条小时环境观测样本

该数据集包含多种环境、光照条件和视角下的车辆图像,图像预处理为 416×416 分辨率,适用于 YOLO、SSD 和 RetinaNet 等现代目标检测模型提供COCO、YOLO、Pascal VOC 和 TensorFlow 格式的多种注释格式,兼容多种机器学习框架,包含平衡的训练/验证/测试分割,以评估模型性能。该数据集通过将每张图像转化为结构化的数值特征,包括全局强度统计、纹理描述符(GLC

文章图片
#语音识别#架构#人工智能 +3
OCR教程汇总丨DeepSeek/百度飞桨/华中科大等开源创新技术,实现OCR高精度、本地化部署

基于视觉-语言预训练框架的系统,如 OpenAI 推出的 GPT-4V(Vision 版本),以及 Google 的 Gemini 系列,都展示了在文档理解、表格解析、复杂版式分析方面的强大能力。不同于传统的级联式 OCR 模型(检测 + 识别),LightOnOCR-2-1B 强调端到端处理能力,能够直接将像素映射为结构化文本,支持多语言识别以及表格、公式等结构化内容的提取。此外,在保持 0.9

文章图片
#人工智能#机器学习#目标检测 +1
告别高昂算力门槛!Cosmos3-Edge用4B参数实现全模态统一生成;Kimi K3 Coding&Debugging Traces数据集:涵盖7大开发场景纯净代码SFT语料

该模型采用 Looped Transformer(循环 Transformer) 架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与

文章图片
#人工智能#数据分析#机器学习 +1
OpenBayes 教程上新丨一键部署 gpt-oss-20b,实测开源推理模型新 SOTA,性能直逼 o3‑mini

OpenAI 终于再度发布开源大模型——gpt-oss-120b 和 gpt-oss-20b,前者以千亿级参数专为复杂推理与知识密集型场景设计,后者则更适合低延迟、本地或专业垂直领域使用

文章图片
教程上新丨9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

针对小模型复杂任务处理能力不足的问题,Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,一款基于 Qwen3.5-9B 打造的推理增强语言模型。相比基础模型 Qwen3.5-9B,Qwythos 在多个评测中实现显著提升,其中 MMLU 提升 34 分,gsm8k-strict 数学推理提升 30 分,证明了小参数模型同样能通过高质量推理数据实现能力跃升。如何让更小

文章图片
#多模态#人工智能
突破视频视角限制:InSpatio-World利用自回归框架实现时空演化;OpenAI发布GeneBench-Pro:专为AI Agent打造基因与生物医学科研评测环境

Nemotron-SFT-SWE-v3 是由 NVIDIA 于 2026 年发布的一个软件工程指令微调数据集,旨在提升大语言模型在 SWE-Bench 风格任务中的代码理解与修复能力。Open-SWE-Traces 是由 NVIDIA 于 2026 年发布的一个面向大语言模型智能体指令微调的数据集,旨在提升模型在软件工程领域的代码修复与多步工具调用能力,广泛应用于代码智能体训练、自动化软件修复系统

文章图片
#人工智能#多模态
OCR 新范式!DeepSeek 以「视觉压缩」替代传统字符识别;Bald Classification数据集助力高精度人像分类

FDAbench-Full 数据集是一个用于评估数据代理(Data Agents)在异构数据分析任务中的表现的综合基准,包含 2,007 个高质量分析任务,覆盖不同数据领域、难度等级与任务类型,用于系统考察模型在数据库查询生成、SQL 理解以及金融数据分析中的能力。AutoDock-GPU_Output 数据集是一组由 AutoDock-GPU 生成的标准对接输出文件(.dlg),包含结合能、构象

文章图片
#分类#数据挖掘#人工智能 +2
    共 80 条
  • 1
  • 2
  • 3
  • 8
  • 请选择