logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

给判断模型装上身体:Jev 接入硬件的两条路,与 VLA 画过的地图

TypeSafe发布Jev:无视觉、无权重下载的托管API,输入文本/结构化状态,输出Choice/Score等类型化判断。社区将其接入四旋翼、机械臂等仿真回路。文章以“接入硬件三问”分析:计算上,Jev单前向并行、延迟方差坍缩,但云端回路只能闭合个位数 Hz,故判断坐 2–5Hz 战术层,控制与安全留确定性代码;信息上,Jev 无视觉,需VLM/CV压缩状态,校准概率存在口径争议、分布内失效与拒

文章图片
#嵌入式#人工智能#云计算 +1
chatglm3实现RAG增强检索

从huggingface或镜像网站下载生成文本嵌入模型,如bert-base-nli-mean-tokens ,其中1_Pooling、onnx和openvino可以不下载,否则加载模型时可能报错,下载后在项目的主目录建立其他文件夹放自己下载的模型,比如RAG(li)/embedding_model/bert-base-nli-mean-tokens。加载本地生成模型和分词器,创建文本生成管道,并

文章图片
#python#人工智能#transformer +2
当“给机器人指路“成为一门数据工程学——SimpleNav 拆解:导航大模型的标准化之争

2026年,具身智能导航领域迎来关键转折:模型正向通用化演进,但研究基础设施仍陷于“手工作坊”困境。清华THUNLP联合OpenBMB开源的SimpleNav,以统一数据协议、可复用训练配置与跨平台评测体系,回应“复现成本高于创新”的行业痛点。它不追求刷榜,而是构建可追溯、可复现的研究闭环——将数据转换、模型训练、评测验证标准化为一次配置即可完成的流程。通过引入LeRobotv3格式、BATS采样

文章图片
#机器人#无人机#AI
2026年上半场AI视频开源项目全景图:11个AIGC项目的能力边界

AI视频工具爆发式增长,但开源协议陷阱、模型接入边界常被模糊。本文深度拆解11个GitHub项目:NarratoAI实为“非商用”协议,Remotion大公司需付费;支持OpenAI兼容≠仅限云端,多款工具可接入Ollama本地部署。按场景匹配:批量短视频选MoneyPrinterTurbo,音乐驱动选CutClaw,完全免费商用选HyperFrames。附7条选择建议+5大误区,帮你避开隐形雷区

文章图片
#人工智能#AIGC#音视频 +1
Mac M1安装ubuntu踩坑记录(含Booting a command list和EFI stub等报错卡住与解决方法)

本文总结了Ubuntu安装过程中问题的解决方法:1. 黑屏问题可通过GRUB界面添加nomodeset、acpi=off noapic参数解决;2. Booting a command list卡住建议更换系统版本;3. Failed unmounting/cdrom需检查CD/DVD设置;4. EFI stub卡住需断开网络安装;5. 网络连接失败需手动启用网卡并配置DHCP;6. 桌面环境安装

文章图片
#ubuntu#linux#服务器 +2
反爬十层妖塔:现代爬虫攻防的立体战争

本文构建了一个十层纵深的反爬攻防体系,揭示了现代风控系统的多维度检测逻辑。从基础网络层的IP质量检测,到传输层的TLS指纹识别,再到设备层的硬件指纹与TEE安全机制,每层都有独立验证逻辑。文章详细剖析了浏览器指纹、协议逆向、行为模式分析等关键技术,并提供了对抗方案,如使用真实移动代理、模拟人类滑动轨迹等。核心观点指出:风控系统的目标不是绝对阻止爬虫,而是通过层层设防提高攻击成本。最终强调,真正的技

文章图片
#爬虫#科技#scrapy +2
清华大学团队联合其他高校发布Harness VLA:给VLA戴上“马具“——记忆引导的Agent如何让冻结策略走出分布外

清华团队提出Harness VLA,放弃训练更大的端到端VLA,转而冻结VLA、用记忆引导的Agent学会“驾驭”它。系统以固定小原语库(含VLA_ACT和解析原语)和Task-Specific/Global双记忆塔为核心,Planner通过文件化REPL显式编排调用,将VLA隔离至接触丰富局部操作,而语义绑定、空间重定位等由Planner负责。在LIBERO-Pro扰动任务中达82.4%,远超基

文章图片
#机器人#人工智能
ABot-World-0:当一块 RTX 5090 能编织无限世界——交互式世界模型的高德解法

高德AMAPCVLab发布ABot-World-0,基于5B参数Wan2.2骨干与三阶段渐进蒸馏(TeacherForcing→ODE蒸馏→LongForcing),实现单张RTX5090上720P/16FPS/1.2秒延迟的无限交互世界闭环rollout。该模型支持键盘动作控制,满足约19GB显存约束,达成小时级稳定不崩溃,并已开放权重与500小时训练数据。

文章图片
#AIGC#人工智能
李飞飞团队发布世界模型Atlas:扔进几张照片,生成接近现实的3D场景

李飞飞创办的World Labs发布Atlas,这是全球首个面向空间智能的全模态世界模型。它基于多模态自回归扩散Transformer架构,将文本、图像、视频锚定于三维坐标,实现相机精准控制生成、稀疏视角3D重建及时空模拟。Atlas不止于生成视频,核心在于为机器人训练合成大规模逼真的RGB与深度数据,打通Real-to-Sim闭环。从理论奠基到PointWorld、TrAct等学术延伸,Atla

文章图片
#AIGC
Microduck:$399 的鸭子,正在重新定义物理 AI 的民主化

2026年8月,Hugging Face与Pollen Robotics推出售价399美元的双足机器人Microduck,预售24小时订单超260万美元,5天突破1万台。它高约25厘米,搭载15个伺服电机和RK3566处理器,行走、踢球等动作通过模拟器和PPO算法强化学习训练,并以ONNX神经网络策略部署。软件栈(固件、训练环境等)完全开源,但硬件设计文件暂未开源。这个机器人续航约1小时,算力有限

文章图片
#机器人#AI#嵌入式 +2
    共 102 条
  • 1
  • 2
  • 3
  • 11
  • 请选择