提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档


前言 为什么选择 AMD 云服务器 + Gemma 4?

2026 年 4 月 2 日,Google DeepMind 发布了 Gemma 4 系列开源模型(Apache 2.0 协议),包含 4 个规格:E2B(20亿有效参数)、E4B(40亿)、12B Dense、26B MoE(~38亿激活参数)和 31B Dense。全系列原生支持多模态(文本+图像+视频+音频)、256K 超长上下文窗口、Function Calling,且对消费级 GPU 极度友好——12B 模型仅需 16GB 显存即可本地运行。
AMD 在 Gemma 4 发布当天即提供 Day 0 全栈支持(ROCm + vLLM + SGLang + Ollama + llama.cpp),这是 AI 开源生态的一个重要信号:AMD 正在从 “能用” 走向 “好用”。本文将利用 AMD 开发者云提供的免费 GPU 资源,完成从零到对话的全流程部署。

一、环境准备:申请 AMD 开发者云免费 GPU

1.1进入 AMD 开发者云平台

  1. 访问 AMD 开发者云(developer.amd.com.cn),建议使用魔搭(ModelScope)账号登录
  2. 进入 AMD AI 开发计划页面,完善个人信息,系统赠送积分(新用户可获得首批免费额度)
  3. 在「我的权益」中,用积分免费兑换云额度(兑换后 30 天内有效)
  4. 兑换后获得链接,粘贴至 AMD 开发者云平台的 Profile → Redeem Credits 完成激活
    1.2 启动 GPU 服务器
    在平台中点击 Launch → Open Notebook → 新建 Terminal,输入:
    amd-smi

笔者的环境配置:GPU 为 AMD Radeon Graphics(集成型高性能 APU),显存约 48GB,ROCm 版本 7.2.1,驱动版本 6.14.14。48GB 显存对于 Gemma 4-E4B 来说绰绰有余——模型权重约 8GB(FP16),KV Cache 预留 4-8GB,完全可以进行推理和轻量微调。
1.3 验证 PyTorch 与 ROCm 的 GPU 识别
python -c “import torch; print(‘PyTorch:’, torch.version); print(‘ROCm available:’, torch.cuda.is_available()); print(‘Device:’, torch.cuda.get_device_name(0))”

如果输出显示 ROCm available: True 且 Device 为 AMD GPU 名称,说明环境就绪。⚠️ 若返回 False,首先检查 pip list | grep torch 确认安装的是 ROCm 版 PyTorch(而非 CUDA 版),必要时重新安装:
pip install torch --index-url https://download.pytorch.org/whl/rocm7.2
1.4 切换 pip 镜像源(加速下载)
pip config set global.index-url https://mirrors.cloud.tencent.com/pypi/simple/
国内环境建议切换至腾讯云/阿里云镜像,海外无需此步骤。

二、模型下载:使用魔搭(ModelScope)拉取 Gemma 4

2.1 安装魔搭
pip install modelscope

魔搭(ModelScope)是阿里巴巴达摩院联合 CCF 开源发展委员会打造的 AI 模型开源社区,可理解为 “中国的 HuggingFace”。截至 2026 年 3 月,已汇聚超 17 万个开源模型,服务全球超 2500 万开发者,包括 DeepSeek、智谱 AI、腾讯、字节跳动等千余家机构入驻。对于国内用户,魔搭的下载速度远超 HuggingFace,且无需科学上网。
2.2 下载 Gemma 4-E4B 模型
执行以下命令,将模型下载到本地 ./models 目录:
modelscope download --model google/gemma-4-E4B-it --cache_dir “./models”
下载完成后验证文件完整性:
ls -lh ./models/google/gemma-4-E4B-it/
核心文件应包括:model.safetensors(权重)、tokenizer.json(分词器)、config.json(模型配置)、generation_config.json 等。与魔搭页面仓库文件列表一致即可。

三、推理服务:vLLM 启动 Gemma 4模型

3.1 vLLM 简介
vLLM(Virtualized Large Language Model)是 UC Berkeley 开发的高性能 LLM 推理框架,核心优势包括:PagedAttention 显存管理(KV Cache 利用率提升 2-4 倍)、Continuous Batching(动态批处理,吞吐量提升 10x+)、以及原生支持 AMD ROCm、Tensor Parallelism 多卡并行。2026 年起,AMD ROCm 已被 vLLM 官方列为 First-Class Platform,意味着 AMD GPU 用户无需任何额外适配即可使用最新 vLLM 特性。
32 ⚠️ 关键踩坑:重装 torchvision
经实测,在该 AMD 云环境中直接安装 vLLM 后可能会遇到 torchvision 版本冲突问题。需要先卸载再重装:
uv pip uninstall torchvision
uv pip install vllm torchvision
–no-cache
–index-url https://mirrors.aliyun.com/pypi/simple/
–extra-index-url https://wheels.vllm.ai/rocm/
-U
注:–extra-index-url 指向 vLLM 官方 ROCm 构建。这里用 uv 而非 pip 是因为 uv 的依赖解析更快且不易产生冲突。如果仍遇到问题,可以尝试先卸载干净旧版本后重新安装。
3.3 启动推理服务
在当前终端启动 vLLM API 服务:
vllm serve ./models/google/gemma-4-E4B-it/
–served-model-name gemma-4-E4B-it
–host 0.0.0.0
–port 8000

服务启动后会在终端输出 “Uvicorn running on http://0.0.0.0:8000” 的日志。此时打开一个新的 Terminal 标签页,测试对话:
vllm chat --url http://localhost:8000/v1 --model gemma-4-E4B-it

如果一切正常,你会看到 “User:” 提示符,输入任意问题即可获得 Gemma 4 的回复。⚠️ 启动后前 30 秒内模型可能还在加载权重到显存,如果报连接错误可以稍等片刻再试。

四、常见问题 FAQ

Q: vLLM 启动后报 “Connection Refused” 怎么办?
A: 大概率模型还在加载中。首次启动需要 30-60 秒将权重从磁盘加载到显存,等终端出现 “Uvicorn running on” 日志后再请求。
Q: AMD 免费额度够用多久?
A: 新用户赠送的积分大致覆盖100小时的 GPU 使用。足够完成本文的部署+测试全流程。若需长期使用,建议搭建本地 AMD 工作站。
参考链接
AMD Gemma 4 Day 0 支持公告:developer.amd.com
Google Gemma 4 技术白皮书:ai.google.dev/gemma
vLLM ROCm 部署指南:docs.vllm.ai
魔搭 ModelScope:modelscope.cn

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐