Agents-A1快速入门:5分钟部署你的第一个智能体推理模型
·
Agents-A1快速入门:5分钟部署你的第一个智能体推理模型
Agents-A1是一个由InternScience开发的35B混合专家智能体模型,旨在跨多个领域扩展异构智能体能力,包括长程搜索、工程、科学研究、指令跟随和工具调用。本指南将帮助你在5分钟内完成Agents-A1智能体推理模型的部署,即使你是AI模型部署的新手。
准备工作:模型文件获取
首先,你需要获取Agents-A1的模型文件。通过以下命令克隆仓库:
git clone https://gitcode.com/hf_mirrors/InternScience/Agents-A1-Q4_K_M-GGUF
克隆完成后,你将在目录中看到以下关键模型文件:
- Agents-A1-Q4_K_M.gguf:主模型文件
- Agents-A1-mmproj.gguf:多模态投影文件
选择部署工具:SGLang还是vLLM?
Agents-A1支持两种主流部署框架,你可以根据自己的需求选择:
SGLang:快速高效的服务框架
SGLang是一个快速的大型语言模型和视觉语言模型服务框架,适合需要高效推理的场景。
vLLM:高吞吐量推理引擎
vLLM是一个高吞吐量和内存高效的推理服务引擎,适合需要处理大量并发请求的场景。
一键安装步骤:SGLang部署
1. 创建并激活虚拟环境
uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
2. 安装SGLang
uv pip install sglang
3. 启动服务(标准版本)
python -m sglang.launch_server \
--model-path InternScience/Agents-A1 \
--port 8000 \
--tp-size 1 \
--mem-fraction-static 0.8 \
--context-length 262144 \
--reasoning-parser qwen3
4. 启用工具调用功能(可选)
如果需要使用工具调用功能,使用以下命令:
python -m sglang.launch_server \
--model-path InternScience/Agents-A1 \
--port 8000 \
--tp-size 1 \
--mem-fraction-static 0.8 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
最快配置方法:vLLM部署
1. 创建并激活虚拟环境
uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
2. 安装vLLM
uv pip install vllm --torch-backend=auto
3. 启动服务(标准版本)
vllm serve InternScience/Agents-A1 \
--port 8000 \
--tensor-parallel-size 1 \
--max-model-len 262144 \
--reasoning-parser qwen3
4. 启用工具调用(可选)
vllm serve InternScience/Agents-A1 \
--port 8000 \
--tensor-parallel-size 1 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
5. 纯文本模式(可选)
如果不需要视觉功能,可以启动纯文本模式以节省内存:
vllm serve InternScience/Agents-A1 \
--port 8000 \
--tensor-parallel-size 1 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--language-model-only
优化生成质量:推荐的采样参数
为了获得最佳的生成质量,建议使用以下采样参数:
temperature: 0.85top_p: 0.95top_k: 20min_p: 0.0presence_penalty: 1.1repetition_penalty: 1.0
你可以在API请求中设置这些参数,或者在启动服务时通过命令行参数指定。
验证部署:测试你的智能体模型
部署完成后,你可以通过访问http://localhost:8000/v1来测试API端点。你可以使用curl命令或任何HTTP客户端发送请求:
curl http://localhost:8000/v1/completions \
-H "Content-Type: application/json" \
-d '{"prompt": "你好,Agents-A1!", "max_tokens": 100, "temperature": 0.85}'
如果一切正常,你将收到Agents-A1的响应。
总结:开始使用Agents-A1智能体
恭喜!你已经成功部署了Agents-A1智能体推理模型。这个35B参数的模型虽然规模适中,但在多个领域展现出了与万亿参数模型相媲美的性能,包括长程搜索、工程任务、科学研究和指令跟随等。
现在,你可以开始探索Agents-A1的强大功能,包括:
- 智能体推理:将复杂任务分解为可执行的子步骤
- 工具使用:原生支持函数调用和工具集成
- 科学和专业推理:处理工具集成的科学推理和专业知识问答
- 指令跟随:精确遵循各种领域的详细、多约束指令
如果你想深入了解Agents-A1的性能,可以查看项目中的评估框架,位于Agents-A1/evaluation目录。
祝你使用Agents-A1愉快!如有任何问题或反馈,欢迎与社区分享。
更多推荐



所有评论(0)