特点
步骤
# 安装
curl -fsSL https://ollama.com/install.sh | sh
# 启动模型
ollama run llama3支持模型:
llama3qwenmistraldeepseekWeb UI:
docker run -p 3000:8080 openwebui/openwebui适合
环境
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
pip install -r requirements.txt运行:
python server.py --gpu-memory 8 --load-in-8bit模型建议:
TheBloke 的 GGUF 模型适合
pip install vllmfrom vllm import LLM
llm = LLM(model="Qwen/Qwen-7B-Chat")| 模型 | 大小 | 建议 |
|---|---|---|
| Qwen2-7B | Q4 | ✅ 中文强 |
| Llama3-8B | Q4 | ✅ 通用 |
| DeepSeek-7B | Q5 | ✅ 代码 |
| Mistral-7B | Q4 | ✅ 英文 |
--load-in-8bit / --load-in-4bitcontext ≤ 4096组合推荐:
Ollama + Open WebUI + Qwen2-7B-Q4
体验接近:
如果你愿意,可以告诉我:
1️⃣ 用途(聊天 / 代码 / 角色扮演)
2️⃣ 是否要 Web 界面
3️⃣ Windows 还是 Linux
我可以直接给你一步步可复制的配置方案。