下面给你一个从硬件到部署的完整思路,假设你说的是 AMD Radeon RX 7700 XT(12GB 显存) 用来跑本地聊天机器人(LLM)。
一、RX 7700 XT 能跑什么级别的模型?
RX 7700 XT:
- 显存:12GB GDDR6
- 架构:RDNA 3
- 支持:ROCm(Linux)
实际可用模型规模(量化后):
- ✅ 7B 模型(Q4 / Q5):非常流畅
- ✅ 13B 模型(Q4):可用,但偏慢
- ❌ 30B+ 模型:不推荐(显存不够)
二、操作系统选择(很重要)
✅ 推荐
- Ubuntu 22.04 / 24.04
- ROCm 支持最好
❌ 不推荐
- Windows(ROCm 支持不完整)
- macOS(不支持)
三、软件方案(最推荐)
方案 1:Ollama(最简单)
适合:快速部署、本地聊天
1. 安装 ROCm
sudo apt update
sudo apt install rocm
2. 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
3. 运行模型
ollama run llama3
(自动使用 RX 7700 XT)
方案 2:LM Studio(图形界面)
- 支持 ROCm
- 适合不懂命令行的用户
- 下载模型 → 一键加载
方案 3:llama.cpp(性能最好)
适合:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j
运行:
./main -m model.gguf -ngl 999
四、聊天前端(可选)
如果你想要“聊天界面”:
docker run -p 3000:3000 ghcr.io/open-webui/open-webui
支持 Ollama
五、推荐模型(RX 7700 XT)
| 模型 | 推荐量化 | 说明 |
|---|
| Llama 3 8B | Q4_K_M | 最稳 |
| Qwen2 7B | Q4 | 中文好 |
| Mistral 7B | Q4 | 轻快 |
| DeepSeek 7B | Q4 | 代码强 |
六、常见问题
1. 显存不够?
2. 速度慢?
- 确保 ROCm 生效
- 用 llama.cpp 而不是 transformers
七、示例:RX 7700 XT + Ollama 聊天机器人
ollama run qwen2
浏览器打开:
http://localhost:3000
✅ 本地、隐私、无云
如果你愿意,我可以:
- 给你 一步一步命令
- 帮你选 中文最佳模型
- 教你 接入微信 / Telegram
- 或做 API 服务
你打算用在什么场景?(个人 / 企业 / 开发)