显存限制(8GB)很关键:
推荐模型:
适合:快速使用、本地聊天
curl -fsSL https://ollama.com/install.sh | shollama run qwen2:7bhttp://localhost:11434✅ 优点:一行命令
适合:调参、角色扮演、API
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
pip install -r requirements.txt运行:
python server.py --gpu-memory 7 --load-in-8bit模型放:
models/✅ 支持 GGUF / GPTQ
适合:开发、服务多个用户
pip install vllm
python -m vllm.entrypoints.api_server \
--model Qwen/Qwen2-7B-Instruct \
--gpu-memory-utilization 0.9✅ 高吞吐
--load-in-8bit--use-flash-attnfrom ollama import chat
response = chat(
model="qwen2:7b",
messages=[{"role": "user", "content": "你好"}]
)
print(response["message"]["content"])Q:会爆显存吗?
A:7B Q4 一般不会,13B 容易。
Q:能联网吗?
A:需额外接 RAG / 搜索 API。
Q:能中文好吗?
如果你愿意,我可以:
你打算用聊天机器人做什么?