登录社区云,与社区用户共同成长
邀请您加入社区
Miles 将 Slime 的"研究级 RL 框架"升级为"Agentic-first 的企业级生产系统",核心创新在于用 Session/TITO 解决多轮 tokenization 正确性,用全异步 + staleness 解决性能,用 R3 + True On-Policy(当前支持 dense 模型)解决稳定性。在 Slime 基础上,Miles 将 Slime 的 "支持 Agentic
本文是《本地AI配置完全攻略》系列第6篇。前5篇分别介绍了DeepSeek本地部署、Page Assist使用、OpenWebUI搭建、联网搜索配置、知识库RAG搭建。本篇将介绍如何配置多模态模型(视觉理解)和语音交互,让本地AI能看图片、能听会说。
这里的功能不固定,我也是随用随加的。因为我的项目比较简单,帧的类型不多,我就在我所有的节点实现的代码中的这部分初始化了四种帧格式,这样就发送起来简单,另外就是不需要来回的看和翻找确认了,尽管这对于程序来讲是一个无意义且浪费资源的行为,但是可以极大的便利我们,当然注释放在这里一样可以提醒,但是这样还有另外一个好处就是,我们做环回测试的时候,可以更方便的在一个MCU配置过滤器。其实和USART的思路大
# Matter协议:智能家居的统一语言> 你的小米灯泡和苹果HomeKit对话,华为音箱和谷歌Nest联动——这不是梦,是Matter正在做的事。这个由Apple、Google、Amazon、三星等巨头联手打造的协议,正在终结智能家居的"方言时代"。## 智能家居的碎片化困境``` 现状(方言时代): Apple HomeKit ──私有协
摘要:本文介绍如何在STM32单片机上实现OLED屏幕的赛博朋克风格文字特效。通过江协科技OLED库,展示了"打字机逐字显示+碎片化消散"动画的实现方法。核心包括:1)计算字符居中的数学公式;2)防残留的清屏机制;3)利用视觉暂留效应实现碎片化效果。文章提供了完整C语言代码,包含打字机效果、高频闪烁过渡和最终消散三个阶段,并给出了参数规范、通信速度限制等避坑建议,帮助开发者突破传统数据显示方式,打
以上只是通用的运行库dll处理方式,如果你遇到缺失文件是第三方的软件文件,那么就需要下载到属于这个程序所匹配的版本的文件,然后将这个文件复制到这个程序的安装目录下才能解决问题。如果我们遇到关于文件在系统使用过程中提示缺少找不到的情况,如果文件是属于运行库文件的可以单独下载文件解决,但还是建议安装完整的运行库,可以尝试采用手动下载替换的方法解决问题!文件下载完成后,下方列表会有很多个不同版本的文件,
SGLang 是由加州大学伯克利分校研发的大模型端侧与分布式推理优化框架,专注于提升LLM在本地设备和分布式环境中的推理效率。该框架通过动态图调度、算子融合等技术,可实现3-10倍的推理速度提升,并显著降低显存占用。SGLang支持多硬件架构(CPU/GPU/NPU),提供简洁的Python API,适用于端侧AI应用、实时推理服务等场景。安装配置简单,支持量化模型加载,并提供了生成、对话等核心A
其实很早就想写这个东西,只是一直没有时间去写,而且看里面的源代码真的很难看懂
在大语言模型技术快速迭代的浪潮中,数据安全与定制化需求推动着私有化部署成为企业和开发者的重要选择。Ollama 和 vLLM 作为两款备受关注的大语言模型部署和推理开源框架,各有千秋。接下来,我们将从多个关键维度对二者进行深度剖析,为你的私有化部署选型提供全面参考,并分享实用的实战经验与避坑技巧。
高通与LM Studio、微软公司和纽约大学坦顿工程学院合作,于12月7日和8日在纽约大学布鲁克林工程校区举办了一场边缘人工智能黑客松。此项活动要求AI开发者仅利用骁龙X Elite NPU和LM Studio的算例,构建具有实际商业价值的边缘大语言模型(LLM)应用程序的挑战。黑客松参与人员我们在160多位意向登记人中,选中了45份申请,形成了20个奋发努力、高度专注的团队 ——他们真的做到了!
Intel® DevCloud - Container PlaygroundThis guide is designed to help you get familiar with all the capabilities of the Intel® DevCloud - Container Playground. Use the notes at the end of each section
微软推出Fara-7B小型语言模型,专为计算机使用场景设计。这款仅70亿参数的轻量级模型在同类中性能领先,支持网页操作等任务。用户可通过LMStudio或VLLM进行推理,但需较高配置(建议H100显卡或8G内存)。安装需克隆GitHub仓库并配置Python环境。目前该模型在魔搭模型库提供GGUF格式版本,但部分用户反馈硬件要求较高,普通设备可能无法流畅运行。
GPU优化的极致性能推理编译器;二者可协同使用——ONNX Runtime通过“TensorRT Execution Provider”调用TensorRT底层,在保持跨平台能力的同时实现NVIDIA GPU上的最高推理速度。ONNX Runtime:以ONNX格式为中间表示,支持CPU、NVIDIA CUDA、AMD ROCm、Intel OpenVINO、NPU等多种硬件后端,主打跨
最近,我们探讨了如何利用Ollama平台在本地部署LLM,但是它所支持的模型种类有限。对于那些渴望接触更广泛的模型的用户来说,Hugging Face提供了一个理想的解决方案。Hugging Face不仅是一个模型和数据集的托管共享社区,更像是机器学习领域的GitHub,专注于LLM等资源的分享。通过使用LM Studio这样的工具,用户可以轻松地在本地下载、托管并运用Hugging Face上的
文章介绍轻量级大模型推理引擎Nano-vLLM,这是代码简洁(约1200行Python)的vLLM替代实现。它提供快速离线推理能力,API与vLLM类似,在小模型测试中性能甚至优于vLLM。文章详解安装方法、模型下载途径(包括modelscope)及基本使用示例,适合在有限硬件资源上部署大模型的开发者学习。2025 年最热门的项目分布在 AI 基础设施(vllm、ollama、huggingfac
Ollama 安装配置指南