logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

​Distil-Whisper:比Whisper快6倍,体积小50%的语音识别模型

此外,Distil-Whisper与Whisper模型共享相同的编码器权重,这意味着它可以作为Whisper的辅助模型,用于推测性解码,从而实现了2倍的推理速度提升,同时确保预测结果与原始模型相同。为了解决这个问题,研究者们采用了伪标签方法来构建一个大规模的开源数据集(在 9 个不同的开源数据集上接受了 22,000 个小时的训练,涵盖 10 个域、超过 18,000 个说话者),并使用这个数据集

#语音识别#人工智能
谷歌人机图像识别接口

ReCaptchaV2Classification: 谷歌验证码 reCaptcha V2 图像识别https://yescaptcha.atlassian.net/wiki/spaces/YESCAPTCHA/pages/18055169

#python#爬虫#人机交互
Umi-OCR :一个完全离线的OCR图片转文字识别软件。

忽略特定区域的文字识别,适合需要从图片中提取大量文本的用户。粘贴图片到软件:在任何地方(如文件管理器,网页,微信)复制图片,软件上点击粘贴按钮或快捷键,自动识别。开源免费,支持截屏或批量导入图片,并能识别多国语言,合并段落,处理竖排文字。自定义识别:用户可以设置忽略图片中的特定区域,只识别需要的文字。命令行调用:支持命令行操作,可以与其他软件联动,如翻译工具等。多语言支持:能够识别多种语言的文字,

文章图片
谷歌验证码 reCaptcha V2 图像识别开发接口

此对象不会返回 RESPONSE, 只返回图像识别结果! 请无接入能力的用户避免使用!创建任务通过 createTask方法 创建识别任务请求地址:https://api.yescaptcha.com/createTask请求格式:JSON POST对象结构属性类型必须说明typestring是ReCaptc

文章图片
#python#爬虫
到底了