logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

MindDrive:融合世界模型与视觉语言模型的端到端自动驾驶框架

本文是对论文《MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving》的深度解读。在端到端自动驾驶领域,轨迹规划中生成与选择失衡是关键挑战。北航等团队提出的 MindDrive 框架,创新整合世界模型与视觉语言模型,通过未

文章图片
#自动驾驶#论文阅读
Molmo&PixMo:全开源视觉语言模型的突破之路

本文是对论文《Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models》的深度解读。在VLM领域,专有模型垄断SOTA性能、开源模型依赖蒸馏的问题突出。本文队提出Molmo开源家族及PixMo数据集,不依赖外部VLM,通过语音标注等创新收集高质量数据,优化架构与训练流程,Molmo

文章图片
#语言模型#人工智能#论文阅读
FastAPI 入门:构建现代 Python Web API 的首选框架

摘要:FastAPI 是一个现代、高性能的 Python Web 框架,专为构建 API 而生。它基于 Python 类型提示,集成 Pydantic 实现自动数据验证,支持异步编程,并能自动生成交互式 API 文档(Swagger UI 和 ReDoc)。本文带你快速入门 FastAPI,从环境搭建、基础路由、数据模型,到分层项目结构与实战示例,助你用更少代码、更高效率构建专业级 API 服务。

文章图片
#python#后端
Python 函数命名全指南:从规范到最佳实践

摘要:在 Python 开发中,良好的命名习惯是写出可读性强、可维护性高代码的关键。函数作为程序的基本构建单元,其命名直接影响代码的清晰度和团队协作效率。本文将全面介绍 Python 函数命名的规则、约定、常见模式以及实际开发中的最佳实践,帮助你写出更 Pythonic 的代码。

文章图片
#python
NVLM-1.0:开源前沿多模态大模型的技术突破

本文是对论文《NVLM: Open Frontier-Class Multimodal LLMs》的深度解读。在多模态大模型领域,如何在提升视觉 - 语言任务性能的同时保持甚至优化文本单模态能力,是关键研究挑战。NVIDIA 团队提出的 NVLM-1.0 系列模型,创新设计解码器、交叉注意力及混合三种架构,结合 1-D Tile-Tagging 高分辨率处理与高质量数据策略,实现开源模型性能新突破

文章图片
#人工智能#论文阅读
Baichuan-Omni:首个开源 7B 全模态大语言模型

本文是对论文《BAICHUAN-OMNI TECHNICAL REPORT》的深度解读。在全模态大模型领域,开源方案常存在模态覆盖不全、交互体验不佳的问题。Baichuan Inc. 联合西湖大学、浙江大学团队推出的 Baichuan-Omni,是首个开源 7B 参数全模态 MLLM,支持文本、图像、视频、音频四模态并发处理,通过 “全模态数据构建→多模态对齐预训练→多任务微调” 流程,及 Con

文章图片
#人工智能#论文阅读
OmniVLA:面向机器人导航的全模态VLA基础模型

本文是对论文《OmniVLA: An Omni-Modal...》的深度解读。在移动机器人导航领域,如何统一语言、目标图像、2D 位姿等多模态目标指令并实现强泛化端到端导航,是亟待解决的核心问题。UC Berkeley 联合丰田、普林斯顿大学提出 OmniVLA 全模态 VLA 模型,基于大规模 VLA 基座与模态掩码训练,在 9500 小时跨平台数据上学习,首次实现多模态目标条件的统一建模,在未

文章图片
#论文阅读
Baichuan-Omni:首个开源 7B 全模态大语言模型

本文是对论文《BAICHUAN-OMNI TECHNICAL REPORT》的深度解读。在全模态大模型领域,开源方案常存在模态覆盖不全、交互体验不佳的问题。Baichuan Inc. 联合西湖大学、浙江大学团队推出的 Baichuan-Omni,是首个开源 7B 参数全模态 MLLM,支持文本、图像、视频、音频四模态并发处理,通过 “全模态数据构建→多模态对齐预训练→多任务微调” 流程,及 Con

文章图片
#人工智能#论文阅读
DETR:基于 Transformer 的端到端目标检测

本文是对论文《End-to-End Object Detection with Transformers》的深度解读。在目标检测领域,传统方法依赖锚点生成、NMS 等人工设计组件,流程复杂且泛化受限。Facebook AI 团队提出的 DETR,创新性地将目标检测视为直接集合预测问题,通过 Transformer 编码器 - 解码器与二分图匹配损失,摒弃冗余组件,实现端到端检测,在 COCO 数据

文章图片
#transformer#目标检测#深度学习 +1
PETR:多视图 3D 目标检测的位置嵌入变换新范式

本文是对论文《PETR: Position Embedding Transformation for Multi-View 3D Object Detection》的深度解读。在自动驾驶多视图 3D 目标检测领域,如何避免复杂 2D-to-3D 投影与特征采样是关键挑战。MEGVII 团队提出的 PETR 框架,创新性地将 3D 坐标编码为位置嵌入注入 2D 特征,生成 3D 位置感知特征,实现端

文章图片
#自动驾驶#论文阅读
    共 81 条
  • 1
  • 2
  • 3
  • 9
  • 请选择