avatar

FuSheng's Blog

← 返回首页

如何部署 DeepSeek:从 API 到本地私有化

DeepSeek

DeepSeek 是目前最流行的开源大模型之一,部署方式主要分两条路:官方 API(零门槛,按量付费)和本地私有化部署(数据不出本地,免费但吃硬件)。这篇文章把两种方式都讲清楚,任选其一即可跑起来。

方式一:官方 API(最快,无需显卡)

适合想快速接入、不想折腾硬件的场景。

1. 打开 DeepSeek 开放平台(platform.deepseek.com)注册账号 2. 进入「API Keys」→ 创建一个 Secret Key(注意:Key 只显示一次,务必保存好) 3. 充值少量余额(新用户通常有赠送额度)

模型选择(2026 年最新)

官方已于 2026 年 7 月 24 日停用旧模型名 deepseek-chat / deepseek-reasoner,现在使用:

  • deepseek-v4-flash:轻量快速,适合日常对话、简单问答,便宜
  • deepseek-v4-pro:更强推理,适合复杂任务,可开启思考模式(thinking)

调用代码(兼容 OpenAI SDK)

因为 DeepSeek API 完全兼容 OpenAI 格式,直接用官方 OpenAI SDK 即可:

from openai import OpenAI

client = OpenAI(
    api_key="sk-你的密钥",      # 换成你的 API Key
    base_url="https://api.deepseek.com"
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "你是一个乐于助人的助手"},
        {"role": "user", "content": "用一句话介绍 DeepSeek"}
    ]
)
print(resp.choices[0].message.content)
小技巧:把 API Key 放到环境变量 DEEPSEEK_API_KEY 里,避免硬编码在代码中。

命令行快速测试(curl)

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"你好"}]}'

方式二:本地部署(Ollama,新手首选)

适合数据敏感、想离线使用、或想免费无限调用的场景。

硬件要求参考

模型显存需求适合显卡
DeepSeek-R1-Distill-Qwen-1.5B2GB随便一台电脑 CPU 都能跑
DeepSeek-R1-Distill-Qwen-7B/8B6-8GBGTX 1060 6G 及以上
DeepSeek-R1-Distill-Llama-14B12GBRTX 3060 12G / 4070
DeepSeek-R1-Distill-70B(量化)40GB+双卡 A100 / 4090×2
DeepSeek-V4 量化版视量化等级显存越大越好

安装 Ollama

  • Windows / macOS:到 ollama.com 下载安装包,双击安装
  • Linux:curl -fsSL https://ollama.com/install.sh | sh

拉取并运行模型

# 小模型,CPU 也能跑,先拿来练手
ollama run deepseek-r1:1.5b

# 稍大一点,效果更好
ollama run deepseek-r1:7b

第一次运行会自动下载模型,之后都是本地离线推理,不花一分钱。

接入 OpenAI 兼容接口

Ollama 自带 OpenAI 兼容 API(默认 11434 端口),现有代码几乎零改动:

ollama serve   # 启动服务
from openai import OpenAI

client = OpenAI(
    api_key="ollama",                                  # 随便填
    base_url="http://localhost:11434/v1"
)

resp = client.chat.completions.create(
    model="deepseek-r1:7b",
    messages=[{"role": "user", "content": "你好"}]
)
print(resp.choices[0].message.content)

进阶:vLLM 部署大模型(生产环境)

如果追求吞吐量或要部署 70B+ 的大模型,推荐用 vLLM:

# 安装
pip install vllm

# 启动 OpenAI 兼容服务(以 R1-Distill 70B 为例)
vllm serve deepseek-ai/DeepSeek-R1-Distill-Llama-70B \
  --tensor-parallel-size 2 \
  --max-model-len 32768

启动后访问 http://localhost:8000/v1,同样兼容 OpenAI SDK。

常见问题

Q:显存不够怎么办? 用更小的量化版本(如 Q4_K_M),或选更小的蒸馏模型(1.5B/7B)。

Q:Ollama 报 "model not found"?ollama pull deepseek-r1:7b 手动拉取,或检查模型名是否拼写正确。

Q:API 报 401/Invalid API Key? 检查 Key 是否复制完整、是否带空格,环境变量是否生效。

Q:本地部署慢? CPU 推理本来就慢,想要速度需要 NVIDIA 显卡 + CUDA;Mac 用 M 系列芯片的 Metal 加速。

总结

  • 想省事 → 官方 API,5 分钟跑通
  • 要隐私 / 免费 → Ollama 本地部署,从 1.5B 小模型开始
  • 生产环境 / 大模型 → vLLM

部署门槛其实很低,先跑起来再说,后面再逐步优化。

💬 0 条评论
暂无评论,快来发表第一条评论吧!
永雏塔菲