logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

个人学习助手 DeepTutor:把论文检索、做题和学习规划一次打通

当下AI学习工具竞争激烈,香港大学推出的DeepTutor实现了学习全流程自动化。这款工具依托多Agent架构整合多项学习功能,还兼备检索、查文献、代码运行等能力,是功能全面的智能学习助手。

文章图片
#RAG#人工智能
LiveCC 首个视频解说大模型开源,比赛视频也能轻松拿捏!

新加坡国立大学 Show Lab 与字节跳动公司于 2025 年 4 月 25 日推出了 LiveCC 模型,这是一个专注于大规模流式语音转录的视频大语言模型项目,旨在通过创新的视频 - 自动语音识别(ASR)流式方法训练出首个具备实时评论能力的视频大语言模型。进入 Demo 页面后,首先上传一段视频,选择「Real-Time Commentary(实时字幕)」,按下回车开始运行。待系统分配好资源

文章图片
#人工智能#深度学习#机器学习
中科院团队发布首个国产类脑脉冲大模型 SpikingBrain-1.0,推理效率达百倍提速

瞬悉 1.0(SpikingBrain-1.0)」核心功能特点在于通过模仿大脑神经元的工作机制,在处理超长序列任务时,能实现惊人的效率和速度提升,同时大幅降低能耗和数据需求。其最新发布的「瞬悉1.0(SpikingBrain-1.0)」类脑脉冲大模型,借鉴大脑神经元的工作机制,成功绕过了传统 Transformer 架构的能效瓶颈,为长序列处理这一业界难题提供了全新的解决方案。登录 OpenBay

文章图片
#人工智能#深度学习#机器学习 +1
VASP 教程:使用 VASP 进行机器学习力场训练

是一个计算机程序,用于从第一性原理进行原子尺度材料建模,例如电子结构计算和量子力学分子动力学。与从头算分子动力学(MD)结合使用的机器学习力场(Category:Machine-learned force fields - VASP Wiki),能够从第一性原理出发捕捉底层物理机制,同时仍能以相对较低的计算成本实现长时间模拟。通常,由于需要对电子进行量子力学处理,例如在密度泛函理论(DFT)框架下

文章图片
#机器学习#人工智能#深度学习
VASP 教程:VASP 机器学习力场计算硅的声子谱

是一个计算机程序,用于从第一性原理进行原子尺度材料建模,例如电子结构计算和量子力学分子动力学。Phonopy()是一款用于在简谐和准简谐水平下计算声子能带结构、热学性质、群速度以及其他与声子相关物理量的 python 工具包。本次教程我们将使用自动化脚本来进行机器学习力场演示计算流程。

文章图片
#机器学习#人工智能#深度学习 +1
32B 参数还能本地跑?Flux.2-dev 这次是真的把「大模型」玩明白了

更让人惊讶的是,它明明有 32B 参数,却因为量化和推理优化做得非常激进,居然能在 RTX 5090,甚至更低显存的显卡上轻轻松松跑起来。能画、能改、能融合,角色风格还不跑偏,让整个创作流程变得快、稳、省心。的出现就像突然给你塞了一把真正能干活的 AI 瑞士军刀——一句话能画图,一张图能修改,几张参考图还能自动融合成统一风格,整套流程一个模型就走通了,再也不用东拼西凑。过去的开源图像模型有点像一柜

文章图片
#人工智能#深度学习#机器学习 +1
当大模型开始「处理长上下文与多模态任务」:Gemma 4 31B it 的统一建模思路

摘要:Google DeepMind 推出的 Gemma-4-31B-it 模型在技术资料整理中展现出显著优势,其基于Gemini3 技术体系,强化了长上下文建模与推理能力。该模型支持 256K 上下文和图文输入,能一次性完成原本需要人工逐步推进的复杂任务,大幅提升工作效率。

文章图片
#GPU#开源#机器学习 +1
160亿的参数,GLM-Image让AI绘图听懂人话

现在的 AI 画图工具,像极了手艺精湛却耳背的 Tony 老师——你说招牌写开业大吉,他画出一串连考古学家都破译不了的符号。开源,为了好用而不只是能用,由智谱华章以开源形式发布的 GLM-Image 打破「高性能=闭源收费」的潜规则。毕竟,我们要的不是抽卡式的运气游戏,而是能听懂复杂需求的靠谱搭档。页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。

文章图片
#人工智能#开发语言#深度学习 +1
当大模型开始「处理长上下文与多模态任务」:Gemma 4 31B it 的统一建模思路

摘要:Google DeepMind 推出的 Gemma-4-31B-it 模型在技术资料整理中展现出显著优势,其基于Gemini3 技术体系,强化了长上下文建模与推理能力。该模型支持 256K 上下文和图文输入,能一次性完成原本需要人工逐步推进的复杂任务,大幅提升工作效率。

文章图片
#GPU#开源#机器学习 +1
3B 参数,毫秒级响应:LocateAnything 如何重新定义开放世界目标检测

NVIDIA 最新推出的 LocateAnything-3B 模型通过创新的 ParallelBoxDecoding 技术实现了视觉语言定位的效率突破。该技术采用并行预测替代传统逐 token 坐标生成,处理速度达到 12.7 框/秒,较自回归方法提升 10 倍,在开放目标检测、OCR、GUI 元素识别等场景中表现优异。模型支持图像/视频全域定位及自然语言指代,显著改善定位精度与效率。

文章图片
#目标检测#人工智能#计算机视觉 +1
    共 80 条
  • 1
  • 2
  • 3
  • 8
  • 请选择