要用 AMD RX 9070 XT 搭建一个本地聊天机器人(LLM Chatbot),核心思路是:
用显卡做本地推理(GPU 加速),跑开源大模型,再用前端或接口提供聊天界面。
下面给你一套可行、较简单、适合个人/小团队的方案。
一、整体架构(推荐)
RX 9070 XT(GPU 推理)
↓
本地 LLM 推理框架(Ollama / LM Studio / vLLM)
↓
聊天前端(Web / API / 微信 / Discord)
RX 9070 XT 是 AMD 显卡,重点:优先用支持 ROCm / DirectML 的方案。
二、硬件与系统建议
1. 硬件
- RX 9070 XT(16GB 显存,够跑 7B~14B 模型)
- 内存:≥32GB
- 系统盘:SSD
2. 操作系统(重要)
✅ 推荐:
- Windows 11(最简单)
- Ubuntu 22.04 / 24.04(性能更好,但配置略复杂)
⚠️ AMD 在 Linux 上需要 ROCm,Windows 上用 DirectML 更省心。
三、最简单的方案(Windows 用户首选)
方案 A:Ollama + 网页聊天(最省事)
1️⃣ 安装 Ollama(Windows)
2️⃣ 运行模型
ollama run qwen2.5:14b
或
ollama run llama3.1:8b
3️⃣ 聊天方式
- 命令行直接聊
- 或用 Web UI:
- Open WebUI
- LobeChat
四、更好看的聊天界面(推荐)
方案 B:Ollama + LobeChat(强烈推荐)
1️⃣ 安装 LobeChat
npm install -g lobechat
或用 Docker:
docker run -p 3210:3210 lobehub/lobe-chat
2️⃣ 连接 Ollama
✅ 效果:像 ChatGPT 的界面,本地运行
五、想更高性能(Linux + ROCm)
方案 C:Ubuntu + ROCm + vLLM
适合:
1️⃣ 安装 ROCm
sudo apt install rocm
2️⃣ 安装 vLLM(AMD 支持版本)
pip install vllm
3️⃣ 启动模型
vllm serve Qwen2.5-14B --gpu-memory-utilization 0.9
4️⃣ 前端调用
- Open WebUI
- 自己写 Python / JS 前端
六、模型推荐(RX 9070 XT 友好)
| 模型 | 显存 | 说明 |
|---|
| Qwen2.5-7B | 8GB | 中文极强 |
| Qwen2.5-14B | 14GB | 推荐 |
| Llama3.1-8B | 8GB | 英文好 |
| DeepSeek-R1-7B | 8GB | 推理强 |
七、常见用途示例
- 本地知识库(RAG)
- 私有客服
- 编程助手
- 离线聊天机器人
八、如果你愿意,我可以继续帮你
你可以告诉我:
- ✅ Windows 还是 Linux?
- ✅ 主要用中文还是英文?
- ✅ 只想聊天,还是接知识库?
- ✅ 要不要对外网开放?
我可以直接给你一步步命令版教程。