logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

OpenBayes 教程上新丨字节开源 InfiniteYou 图像生成框架,实现高保真面部特征迁移

1. 进入 Demo 页面后,首先在「Identity Image」处上传包含人脸的照片,然后输入 Prompt,并在「Model Version」处选择模型版本,这里默认使用「aes_stage2」以获得更好的图文对齐和生成效果,如需更高的 ID 相似度,请尝试「sim_stage1」。3. 选择「NVIDIA RTX A6000」以及「PyTorch」镜像,OpenBayes 平台提供了 4

文章图片
#人工智能#深度学习#AI
OpenBayes 教程上新|YOLOv11 实战!速度与精度双全的目标检测神器

YOLO 模型一直是目标检测的经典之选。YOLOv11 作为新一代的目标检测模型,YOLOv11 能够同时完成多个视觉任务:从基础的物体检测和物体分类,到精细的实例分割,甚至能通过姿态估计分析人体或物体的动作。同时,YOLOv11 在定位物体检测方面也表现出色,能够精准地定位并识别图像中的目标,满足更复杂场景的需求。例如,在自动驾驶中,它不仅能精准识别前方车辆和行人,还能准确定位车道线和交通标志,

文章图片
#目标检测#人工智能#自然语言处理 +3
OpenBayes 龙年福袋来袭,¥9.9 购价值 ¥99 算力礼包

OpenBayes 新春福利「龙」重登场!即日起至 2024 年 2 月 29 日 23:59,购买 9.9 元龙年福袋,即可获总价值为 99 元的多种算力资源!

文章图片
#人工智能#机器学习#语言模型 +3
OpenBayes 一周速览丨对标GPT-4o! BAGEL统一处理多模态数据理解和生成任务; 专为软件工程任务设计, Devstral自主处理复杂工程问题

该模型旨在统一处理文本、图像、视频等多模态数据的理解与生成任务。MedGemma-4b-it 专为医疗图像与文本的联合分析设计,采用了 SigLIP 图像编码器,该编码器经过专门预训练,使用的数据涵盖去标识化的医学图像,包括胸部 X 光、皮肤病图像、眼科图像和组织病理切片。该模型在推理基准测试中表现出强大的性能,可与 DeepSeek-R1、Qwen3-235B-A22B、Seed1.5-Thin

文章图片
#语言模型#机器学习#深度学习
OpenBayes 一周速览丨Nanonets-OCR-s深度语义理解,精准结构化转换;HLE人类问题推理基准上线,含2.5k题目,助力封闭式评估体系构建

DeepSeek-R1-0528-Qwen3-8B 参数量为 80 亿,通过将 DeepSeek-R1-0528 的复杂推理能力蒸馏到较小的 Qwen3-8B 基座模型上,融合了 Qwen3 的多语言能力和 DeepSeek-R1 的推理优化,性能媲美 GPT-4,支持单卡高效部署,是学术与企业应用的理想选择。Nanonets-OCR-s 能识别文档中的多种元素,比如数学公式、图片、签名、水印、复

文章图片
#人工智能#视频生成
强化文字渲染与海报排版:百度开源文生图模型 ERNIE-Image-Turbo;告别大模型「遗忘」:微软 OpenMementos 上下文压缩训练数据集上线

本文介绍了5个公共数据集和5个AI相关教程资源。数据集包括遥感图像、智能体推理、文档解析、记忆压缩和食品检测等专业领域,涵盖多模态数据和应用场景。教程资源覆盖神经网络构建、视频目标跟踪、大模型应用、图像生成和扩散模型等热门AI技术,提供从基础到进阶的学习路径。

文章图片
#百度#开源#深度学习 +2
教程上新丨强化学习仿真实操:Legged Gym 框架结构及奖励函数设计思路

摘要:LeggedGym 是基于 IsaacGym 开发的强化学习仿真框架,通过深度封装 PPO 等算法大幅降低腿足机器人控制开发门槛。该框架支持7类机器人控制任务,包括四足机器狗(A1 / Anymal 系列)在平地和粗糙地形的步态生成、双足机器人(Cassie / PF2)行走等高难度任务,开发者只需专注奖励函数设计即可快速验证算法。

文章图片
#机器人#算法#仿真
GLM-4.7-Flash:高性能、高吞吐轻量化的 MoE 推理模型;Delhi Pollution AQl:超过二十万条小时环境观测样本

该数据集包含多种环境、光照条件和视角下的车辆图像,图像预处理为 416×416 分辨率,适用于 YOLO、SSD 和 RetinaNet 等现代目标检测模型提供COCO、YOLO、Pascal VOC 和 TensorFlow 格式的多种注释格式,兼容多种机器学习框架,包含平衡的训练/验证/测试分割,以评估模型性能。该数据集通过将每张图像转化为结构化的数值特征,包括全局强度统计、纹理描述符(GLC

文章图片
#语音识别#架构#人工智能 +3
OCR教程汇总丨DeepSeek/百度飞桨/华中科大等开源创新技术,实现OCR高精度、本地化部署

基于视觉-语言预训练框架的系统,如 OpenAI 推出的 GPT-4V(Vision 版本),以及 Google 的 Gemini 系列,都展示了在文档理解、表格解析、复杂版式分析方面的强大能力。不同于传统的级联式 OCR 模型(检测 + 识别),LightOnOCR-2-1B 强调端到端处理能力,能够直接将像素映射为结构化文本,支持多语言识别以及表格、公式等结构化内容的提取。此外,在保持 0.9

文章图片
#人工智能#机器学习#目标检测 +1
    共 85 条
  • 1
  • 2
  • 3
  • 9
  • 请选择