告别高昂算力门槛!Cosmos3-Edge用4B参数实现全模态统一生成;Kimi K3 Coding&Debugging Traces数据集:涵盖7大开发场景纯净代码SFT语料
公共资源速递
2 个公共数据集:
* PerceptionBench 视觉感知能力基准数据集
* Kimi K3 Coding & Debugging traces 编程调优轨迹数据集
11 个公共教程:
* OvisOCR2 文档解析
* Lyft 自动驾驶轨迹预测
* Titanic 生存预测入门教程
* RoBERTa Tweet 情感文本抽取
* Cosmos3-Edge 全模态世界模型
* Keras 深度学习基础教程 — 乳腺癌分类
* GROMACS 入门:1AKI 蛋白建模与平衡
* Recommendation Engine 共购推荐引擎
* 灾难推文分类:使用 BERT 进行 NLP 文本分类
* Nanbeige4.2-3B: 紧凑体型超越 9B 智能体性能
* MOSS-Transcribe-Diarize:端到端音频理解模型
访问官网立即使用:openbayes.com
公共数据集
1. PerceptionBench 视觉感知能力基准数据集
该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与 3D 感知、空间定位、比较推理、细粒度识别、上下文整合、OCR 文本理解及感知相关幻觉等类别。
* 在线使用:
https://go.openbayes.com/bLVdg
2. Kimi K3 Coding & Debugging traces 编程调优轨迹数据集
该数据集共包含来自 577 个完整轨迹的 3,906 行训练数据。任务涵盖系统构建与实现、缺陷诊断与调试、工具调用与编排、项目迁移与整合、错误恢复、安全加固以及功能开发等类别。
* 在线使用:
https://go.openbayes.com/z3iIt
公共教程
1. OvisOCR2 文档解析
OvisOCR2 模型由 ATH-MaaS 团队于 2026 年 7 月发布,是一个紧凑的 0.8B 端到端文档解析模型。该模型通过对 Qwen3.5-0.8B 进行后训练构建,采用精心设计的数据引擎(结合真实数据与合成数据)以及集成 SFT、RL 和 OPD 的多阶段训练策略。
* 在线运行:
https://go.openbayes.com/papJ3

项目示例
2. Lyft 自动驾驶轨迹预测
Lyft Motion Prediction 是 Lyft 在 2020 年举办的 Kaggle 竞赛,任务是根据自动驾驶场景中的上下文信息,预测智能体(车辆、行人等)未来 5 秒的运动轨迹(50 个时间步,10Hz)。
* 在线运行:
https://go.openbayes.com/rSeh4

项目示例
3. Titanic 生存预测入门教程
Titanic - Machine Learning from Disaster 是 Kaggle 平台上最经典的入门竞赛之一。任务目标是根据乘客的个人信息(舱位等级、性别、年龄、家庭规模等),预测其在泰坦尼克号沉船事故中是否幸存。
* 在线运行:
https://go.openbayes.com/DqlzR

数据分析
4. RoBERTa Tweet 情感文本抽取
RoBERTa 模型是由 Facebook AI 团队于 2019 年 7 月发布,其核心创新与特点为在 BERT 基础上引入动态掩码策略、更大批次训练和更多训练数据,显著提升了 NLP 基准测试性能。本教程基于 Kaggle Grandmaster Chris Deotte 在 Tweet Sentiment Extraction 竞赛中的经典方案,将情感文本抽取任务转化为问答问题:给定推文和情感类型,预测情感关键短语的起始和结束位置。
* 在线运行:
https://go.openbayes.com/i1PRP
5. Cosmos3-Edge 全模态世界模型
Cosmos3-Edge 是由 NVIDIA 团队于 2026 年 7 月发布的 4B 参数全模态世界基础模型,核心创新与特点为采用混合 Transformer(MoT)架构,在一个统一框架内融合自回归 Transformer 和扩散 Transformer,分别处理文本生成和图像/视频/动作等多模态生成。
* 在线运行:
https://go.openbayes.com/sycGY

项目示例
6. Keras 深度学习基础教程 — 乳腺癌分类
本教程源自 Kaggle 上 Paras Jindal 于 2026年7月 发布的入门级深度学习项目,使用 Keras Sequential API 构建神经网络模型,对乳腺癌细胞特征数据进行良恶性二分类。
* 在线运行:
https://go.openbayes.com/eoRwK

模型汇总对比
7. GROMACS 入门:1AKI 蛋白建模与平衡
GROMACS 是一个用于分子动力学模拟的自由开源软件包,主要针对蛋白质、脂质和核酸等生物大分子的模拟进行了优化,也是目前使用最广泛的 MD 引擎之一。本次教程以溶菌酶(1AKI)为例,完成蛋白质在水溶液中的建模与平衡:从 PDB 结构出发,经过溶剂化、离子添加、能量最小化和 NVT 平衡,为后续成品分子动力学模拟做好准备。
* 在线运行:
https://go.openbayes.com/BErNZ

项目示例
8. Recommendation Engine 共购推荐引擎
共购推荐引擎(Co-Purchase Recommendation Engine)是一个基于 Chris Deotte 的 Kaggle Notebook Recommend Items Purchased Together 的推荐系统,该 Notebook 于 2022 年 2 月发布。其核心创新在于通过分析历史交易数据构建共购矩阵,从而推荐经常一起购买的商品,融合了三种策略:历史购买频率、共购模式和热门商品兜底。该算法在 H&M 个性化时尚推荐竞赛中取得了 MAP@12 = 0.021 的成绩。
* 在线运行:
https://go.openbayes.com/8nYe1
9. 灾难推文分类:使用 BERT 进行 NLP 文本分类
本教程基于 Kaggle 上 xhlulu 的经典 Notebook,使用 BERT 进行灾难推文二分类。本教程通过一个完整的 NLP 实战项目,带你从零搭建 BERT 文本分类 pipeline:数据加载 → Tokenization 编码 → 模型构建 → 训练微调 → 推理预测。你将学会如何将预训练 BERT 应用于自定义二分类任务,并理解 [CLS] token、sigmoid 输出层等关键设计选择背后的原理。
* 在线运行:
https://go.openbayes.com/Mojnu
10. Nanbeige4.2-3B: 紧凑体型超越 9B 智能体性能
Nanbeige4.2-3B 是由南北阁(Nanbeige)于2026年 7 月开发的紧凑型智能体模型,基于 Nanbeige4.2-3B-Base 构建。该模型采用 Looped Transformer(循环 Transformer) 架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。
* 在线运行:
https://go.openbayes.com/GXown

项目示例
11. MOSS-Transcribe-Diarize:端到端音频理解模型
MOSS-Transcribe-Diarize 是由 MOSI.AI 团队于 2026 年 7 月发布的端到端多说话人音频理解模型。只需一次推理,模型即可同时完成语音转写和说话人分离,输出带有时间戳和匿名说话人标签(如 [S01]、[S02])的结构化文本。
* 在线运行:
https://go.openbayes.com/YlrfX

项目示例
更多推荐

所有评论(0)