目前市面上权重开放(Open Weights)、支持本地下载部署且允许再训练(微调) 的知名大模型非常多。只要模型发布了权重文件(通常在 Hugging Face 或 ModelScope 魔搭社区),你就可以立即下载到本地。

以下是目前主流、生态成熟且支持本地部署与微调的模型清单,按推荐程度分类:

1. 综合性能最强(首选推荐)

Qwen 2.5 系列 (阿里巴巴)
  • 模型尺寸: 0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B 等。
  • 本地部署: ⭐⭐⭐⭐⭐ (支持极好,中文理解能力开源界第一梯队)
  • 支持再训练: 支持
    • 技术: 社区微调工具(如 LLaMA-Factory)支持完善。
    • 协议: 大部分版本(如 7B, 72B)采用 Apache 2.0 协议。这意味着你可以自由微调、商用、修改,限制极少,非常适合企业和个人二次开发。
  • 适用场景: 中文业务、通用对话、代码生成、长文本处理。
Llama 3.1 系列 (Meta)
  • 模型尺寸: 8B, 70B, 405B (405B 本地部署难度极大,通常建议 8B 或 70B)。
  • 本地部署: ⭐⭐⭐⭐⭐ (生态最丰富,Ollama、LM Studio 等工具首选支持)
  • 支持再训练: 支持
    • 技术: 全球教程最多,微调脚本最丰富。
    • 协议: Llama Community License。允许微调和商用,但如果你的产品月活超过 7 亿,需单独申请授权;禁止用其输出数据训练其他模型。
  • 适用场景: 英文业务、逻辑推理、需要最强社区支持的场景。

2. 轻量级与特定场景优选

Gemma 2 系列 (Google)
  • 模型尺寸: 2B, 9B, 27B。
  • 本地部署: ⭐⭐⭐⭐ (对显存优化较好,适合消费级显卡)
  • 支持再训练: 支持
    • 协议: Gemma Terms of Use。允许商用和微调,但有一些使用条款限制(如不得用于恶意用途)。
  • 适用场景: 显存有限(如单张 3060/4060)、轻量级应用。
Mistral / Mixtral 系列 (Mistral AI)
  • 模型尺寸: Mistral 7B, Mixtral 8x7B, 8x22B。
  • 本地部署: ⭐⭐⭐⭐ (Mixtral 为 MoE 架构,推理速度快)
  • 支持再训练: 支持
    • 协议: 大部分采用 Apache 2.0,非常宽松,允许商用。
  • 适用场景: 多语言支持、逻辑推理、追求开源协议宽松度。
DeepSeek V2.5 / V2 (深度求索)
  • 模型尺寸: DeepSeek-V2-Lite, DeepSeek-V2 (MoE 架构)。
  • 本地部署: ⭐⭐⭐⭐ (性价比高,推理成本低)
  • 支持再训练: 支持
    • 协议: 开源协议允许微调和商用(具体需查看模型卡片)。
  • 适用场景: 代码生成、数学推理、高性价比部署。
Phi-3 系列 (Microsoft)
  • 模型尺寸: 3.8B (mini), 7B, 14B。
  • 本地部署: ⭐⭐⭐⭐⭐ (专为边缘设备设计,手机/低配电脑可跑)
  • 支持再训练: 支持
    • 协议: MIT 协议(最宽松之一)。
  • 适用场景: 端侧部署、低显存环境、快速推理。

关于“支持再训练”的详细说明

提到“再训练”,通常指的是微调(Fine-tuning),而不是从头预训练(Pre-training)。

  1. 技术上是否支持?

    • 上述所有模型都支持。 只要你能下载到权重文件(.safetensors 或 .bin),就可以使用框架进行微调。
    • 常用微调方法: LoRA 或 QLoRA(高效微调,显存占用低)、Full Fine-tuning(全量微调,显存要求高)。
    • 推荐工具: LLaMA-Factory(目前最流行的开源微调框架,支持上述所有模型,带有 WebUI 界面,操作简单)。
  2. 法律上是否允许?

    • 最宽松 (Apache 2.0 / MIT): Qwen 2.5, Mistral, Yi-1.5, Phi-3。你可以微调后闭源商用,几乎无限制。
    • 较宽松 (Community License): Llama 3.1。可以商用,但有用户规模限制和禁止衍生模型训练的限制。
    • 注意: 下载前务必在 Hugging Face 或 ModelScope 的模型页面查看 License 文件。

本地部署与微调的硬件建议

模型参数量量化后显存需求 (推理)微调显存需求 (QLoRA)推荐显卡
3B - 8B6GB - 8GB12GB - 16GBRTX 3060(12G), 4060Ti(16G), 4090
14B - 32B10GB - 20GB24GB - 48GBRTX 3090(24G), 4090(24G), 双卡
70B - 72B40GB - 48GB80GB+ (多卡)双 RTX 3090/4090, 或 A100/A800

总结建议

  1. 如果你想做中文应用且希望商用无忧 首选 Qwen 2.5 (7B 或 72B)。Apache 2.0 协议最安全,中文效果最好。
  2. 如果你主要做英文应用或追求全球生态: 首选 Llama 3.1 (8B 或 70B)。教程最多,遇到问题最容易找到解决方案。
  3. 如果你显存有限(<12GB): 首选 Phi-3 mini 或 Gemma 2 2B/9B
  4. 如果你侧重代码开发: 首选 DeepSeek V2.5 或 Qwen 2.5-Coder

下载渠道:

  • 国内用户推荐:ModelScope (魔搭社区) (下载速度快)
  • 国际用户推荐:Hugging Face (模型最全)

部署工具推荐:

  • 新手推理:Ollama (命令行一键运行), LM Studio (图形界面)
  • 进阶微调:LLaMA-Factory

更多推荐