logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

GPT Image 1.5:OpenAI 的“图像导演”,让 AI 真正听懂你的每一句话

OpenAI 正式推出其新一代图像生成模型 GPT Image 1.5,并同步在 ChatGPT 中上线独立的 “Images” 标签页。

文章图片
#人工智能#图像处理
开发一个人脸识别项目基本流程

总之,做一个人脸识别项目需要从需求分析、数据收集、算法选择、模型训练到系统集成等多个方面进行考虑和实现。2. 收集和标注数据集:数据集是训练模型的重要基础,需要收集大量的人脸图像数据,并进行标注。1. 确定项目需求和目标:首先需要明确项目的需求和目标,例如是用于门禁系统还是安防监控系统,需要识别多少人脸,需要多大的准确率等等。3. 选择合适的算法和模型:根据项目需求和目标,选择合适的算法和模型。常

文章图片
#计算机视觉#人工智能
VideoPipe:轻量级C++视频分析框架的革命性突破

VideoPipe 是一个用于视频分析和结构化的 C++框架,依赖性极小且易于使用。它像管道一样运行,每个节点都是独立的,可以以多种方式组合。

文章图片
#c++#音视频
微软开源的实时 TTS 模型 VibeVoice-Realtime-0.5B,首包延迟仅为 300 毫秒

VibeVoice 不仅是一个 TTS 模型,更是一次对“实时、多角色、长上下文人类级语音合成”的系统性探索。它证明了:小模型也能实现大突破——在 0.5B 参数下,兼顾速度、表现力与可扩展性。

文章图片
#人工智能#语言模型
可以媲美YOLO的开源实时目标检测模型:RF-DETR,在 COCO 上达到 SOTA 水平,并专为微调设计

RF-DETR 是第一个在 Microsoft COCO 基准测试中超过 60 AP 的实时模型,同时在基础尺寸下具有竞争力。

文章图片
#目标跟踪#人工智能#计算机视觉
图像分析技术大比拼:图像分类、图像识别、目标检测的优缺点分析与算法比较

图像分类、图像识别和目标检测是计算机视觉领域中三个重要的任务,它们之间有些许的关系,但也有很大的区别。在实际应用中,需要根据具体的场景和需求选择合适的任务和算法。

文章图片
#目标检测#计算机视觉#深度学习
基于 nano banana pro 的 PPT 生成框架:自然语言编辑 + 局部重绘已实现

Banana-slides:基于nano banana pro模型开源的一款原生且高自由度的AI PPT生成项目,支持仅输入想法/大纲/页面描述即可生成完整PPT演示文稿、文本图片链接自动提取、上传任意素材、口头提出修改,迈向真正的"Vibe PPT"。

文章图片
#语言模型
告别“机械扫描”:DeepSeek-OCR-2用“视觉因果流”让AI像人一样读懂文档

DeepSeek-OCR-2不是更快的OCR工具,而是一次视觉编码范式的重构——它让AI从“机械扫描像素”升级为“理解文档语义逻辑”,首次在端到端模型中实现接近人类的阅读顺序还原能力。

文章图片
机器人不再笨手笨脚!Meta推出新一代视觉世界模型V-JEPA 2

V-JEPA 2 是一种自监督方法,用于训练视频编码器,它使用互联网规模的视频数据,在运动理解和人类行为预测任务上达到了最先进的性能。

文章图片
#机器人#人工智能
    共 45 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择