NVIDIA NIM
概述¶
NVIDIA NIM (NVIDIA Inference Microservices) 是 NVIDIA 的 AI 推理微服務,透過 build.nvidia.com 免費提供 80+ 個領先模型(如 DeepSeek、Qwen、GLM、Kimi、Llama、Nemotron)的 API 存取。兼容 openai 接口,無需信用卡,適合原型開發、測試及個人/研究用途。
免費 API 存取¶
- 註冊 NVIDIA Developer Program 並登入 build.nvidia.com
- 在右上角頭像 → API Keys → Generate API Key,取得
nvapi-格式的 Key - 使用 OpenAI SDK 呼叫,base_url 為
https://integrate.api.nvidia.com/v1
from openai import OpenAI
client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-...")
response = client.chat.completions.create(model="deepseek-ai/deepseek-v4", messages=[...])
免費額度與限制¶
- 多數模型完全免費,無需 credits
- Rate limit 約 40 RPM(視流量與模型而定),高峰期可能更嚴格
- 主要供開發/原型使用,不保證 SLA;生產環境建議自托管 NIM 或購買 NVIDIA AI Enterprise
- 遇到 429 時可稍候重試,或向 NVIDIA 申請提高限流
與 LiteLLM 整合¶
litellm 原生支援 NVIDIA NIM,使用 nvidia_nim/ 前綴即可路由。透過環境變數 NVIDIA_NIM_API_KEY 設定 Key,於 config.yaml 中加入模型,並搭配 drop_params: true 避免非 OpenAI 工具傳入參數出錯。
model_list:
- model_name: deepseek-v4
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4
api_key: os.environ/NVIDIA_NIM_API_KEY
Docker 部署與 UI 設定¶
若以 docker 部署 LiteLLM(例如 oracle-cloud VPS),需在 docker-compose.yml 設定 NVIDIA_NIM_API_KEY 和 STORE_MODEL_IN_DB=True,才能在 LiteLLM UI 新增模型。別忘了在 Oracle Cloud Security List 開啟 4000 port。
Virtual Keys 應用¶
LiteLLM 的 Virtual Keys 可建立多個子 Key,用於浸沉翻譯或不同工具(如 SillyTavern),可設定預算、RPM/TPM 限制並綁定特定模型(例如 Groq 的 llama 模型),方便管理與安全控管。
相關資源¶
- NVIDIA Developer NIM
- Docker 自托管 NIM:下載容器在自己的 GPU 上運行,無 API 限制
- NGC (NVIDIA GPU Cloud) 提供容器與模型下載