公共资源速递

2 个公共数据集:

* PerceptionBench 视觉感知能力基准数据集

* Kimi K3 Coding & Debugging traces 编程调优轨迹数据集

11 个公共教程:

* OvisOCR2 文档解析

* Lyft 自动驾驶轨迹预测

* Titanic 生存预测入门教程

* RoBERTa Tweet 情感文本抽取

* Cosmos3-Edge 全模态世界模型

* Keras 深度学习基础教程 — 乳腺癌分类

* GROMACS 入门:1AKI 蛋白建模与平衡

* Recommendation Engine 共购推荐引擎

* 灾难推文分类:使用 BERT 进行 NLP 文本分类

* Nanbeige4.2-3B: 紧凑体型超越 9B 智能体性能

* MOSS-Transcribe-Diarize:端到端音频理解模型

访问官网立即使用:openbayes.com

公共数据集

1. PerceptionBench 视觉感知能力基准数据集
该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与 3D 感知、空间定位、比较推理、细粒度识别、上下文整合、OCR 文本理解及感知相关幻觉等类别。

* 在线使用:

https://go.openbayes.com/bLVdg

2. Kimi K3 Coding & Debugging traces 编程调优轨迹数据集
该数据集共包含来自 577 个完整轨迹的 3,906 行训练数据。任务涵盖系统构建与实现、缺陷诊断与调试、工具调用与编排、项目迁移与整合、错误恢复、安全加固以及功能开发等类别。

* 在线使用:

https://go.openbayes.com/z3iIt

公共教程

1. OvisOCR2 文档解析

OvisOCR2 模型由 ATH-MaaS 团队于 2026 年 7 月发布,是一个紧凑的 0.8B 端到端文档解析模型。该模型通过对 Qwen3.5-0.8B 进行后训练构建,采用精心设计的数据引擎(结合真实数据与合成数据)以及集成 SFT、RL 和 OPD 的多阶段训练策略。

* 在线运行:

https://go.openbayes.com/papJ3

图片

项目示例

2. Lyft 自动驾驶轨迹预测

Lyft Motion Prediction 是 Lyft 在 2020 年举办的 Kaggle 竞赛,任务是根据自动驾驶场景中的上下文信息,预测智能体(车辆、行人等)未来 5 秒的运动轨迹(50 个时间步,10Hz)。

* 在线运行:

https://go.openbayes.com/rSeh4

图片

项目示例

3. Titanic 生存预测入门教程

Titanic - Machine Learning from Disaster 是 Kaggle 平台上最经典的入门竞赛之一。任务目标是根据乘客的个人信息(舱位等级、性别、年龄、家庭规模等),预测其在泰坦尼克号沉船事故中是否幸存。

* 在线运行:

https://go.openbayes.com/DqlzR

图片

数据分析

4. RoBERTa Tweet 情感文本抽取

RoBERTa 模型是由 Facebook AI 团队于 2019 年 7 月发布,其核心创新与特点为在 BERT 基础上引入动态掩码策略、更大批次训练和更多训练数据,显著提升了 NLP 基准测试性能。本教程基于 Kaggle Grandmaster Chris Deotte 在 Tweet Sentiment Extraction 竞赛中的经典方案,将情感文本抽取任务转化为问答问题:给定推文和情感类型,预测情感关键短语的起始和结束位置。

* 在线运行:

https://go.openbayes.com/i1PRP

5. Cosmos3-Edge 全模态世界模型

Cosmos3-Edge 是由 NVIDIA 团队于 2026 年 7 月发布的 4B 参数全模态世界基础模型,核心创新与特点为采用混合 Transformer(MoT)架构,在一个统一框架内融合自回归 Transformer 和扩散 Transformer,分别处理文本生成和图像/视频/动作等多模态生成。

* 在线运行:

https://go.openbayes.com/sycGY

图片

项目示例

6. Keras 深度学习基础教程 — 乳腺癌分类

本教程源自 Kaggle 上 Paras Jindal 于 2026年7月 发布的入门级深度学习项目,使用 Keras Sequential API 构建神经网络模型,对乳腺癌细胞特征数据进行良恶性二分类。

* 在线运行:

https://go.openbayes.com/eoRwK

图片

模型汇总对比

7. GROMACS 入门:1AKI 蛋白建模与平衡

GROMACS 是一个用于分子动力学模拟的自由开源软件包,主要针对蛋白质、脂质和核酸等生物大分子的模拟进行了优化,也是目前使用最广泛的 MD 引擎之一。本次教程以溶菌酶(1AKI)为例,完成蛋白质在水溶液中的建模与平衡:从 PDB 结构出发,经过溶剂化、离子添加、能量最小化和 NVT 平衡,为后续成品分子动力学模拟做好准备。

* 在线运行:

https://go.openbayes.com/BErNZ

图片

项目示例

8. Recommendation Engine 共购推荐引擎

共购推荐引擎(Co-Purchase Recommendation Engine)是一个基于 Chris Deotte 的 Kaggle Notebook Recommend Items Purchased Together 的推荐系统,该 Notebook 于 2022 年 2 月发布。其核心创新在于通过分析历史交易数据构建共购矩阵,从而推荐经常一起购买的商品,融合了三种策略:历史购买频率、共购模式和热门商品兜底。该算法在 H&M 个性化时尚推荐竞赛中取得了 MAP@12 = 0.021 的成绩。

* 在线运行:

https://go.openbayes.com/8nYe1

9. 灾难推文分类:使用 BERT 进行 NLP 文本分类

本教程基于 Kaggle 上 xhlulu 的经典 Notebook,使用 BERT 进行灾难推文二分类。本教程通过一个完整的 NLP 实战项目,带你从零搭建 BERT 文本分类 pipeline:数据加载 → Tokenization 编码 → 模型构建 → 训练微调 → 推理预测。你将学会如何将预训练 BERT 应用于自定义二分类任务,并理解 [CLS] token、sigmoid 输出层等关键设计选择背后的原理。

* 在线运行:

https://go.openbayes.com/Mojnu

10. Nanbeige4.2-3B: 紧凑体型超越 9B 智能体性能

Nanbeige4.2-3B 是由南北阁(Nanbeige)于2026年 7 月开发的紧凑型智能体模型,基于 Nanbeige4.2-3B-Base 构建。该模型采用 Looped Transformer(循环 Transformer) 架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。

* 在线运行:

https://go.openbayes.com/GXown

图片

项目示例

11. MOSS-Transcribe-Diarize:端到端音频理解模型

MOSS-Transcribe-Diarize 是由 MOSI.AI 团队于 2026 年 7 月发布的端到端多说话人音频理解模型。只需一次推理,模型即可同时完成语音转写和说话人分离,输出带有时间戳和匿名说话人标签(如 [S01]、[S02])的结构化文本。

* 在线运行:

https://go.openbayes.com/YlrfX

图片

项目示例

更多推荐