sudo apt update
sudo apt install -y python3 python3-venv python3-pip
python3 -m venv openelm-env
source openelm-env/bin/activateCPU 版(快速测试)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpuGPU 版(CUDA 12.1 示例)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121pip install transformers accelerateOpenELM 已在 Hugging Face 上线,例如:
apple/OpenELM-270Mapple/OpenELM-450Mapple/OpenELM-1_1Bfrom transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "apple/OpenELM-450M"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
trust_remote_code=True
)
prompt = "Once upon a time"
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs, max_length=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))model = AutoModelForCausalLM.from_pretrained(
model_name,
device_map="auto",
torch_dtype="auto"
)或手动:
model.to("cuda")python -c "
from transformers import pipeline
pipe = pipeline('text-generation', model='apple/OpenELM-450M')
print(pipe('Hello, world'))
"| 问题 | 解决方案 |
|---|---|
| 显存不足 | 换小模型(270M / 450M) |
| 下载慢 | 设置 HF 镜像:HF_ENDPOINT=https://hf-mirror.com |
| 报错 trust_remote_code | 加 trust_remote_code=True |
| 想本地部署 | git clone + transformers 本地加载 |
✅ 量化部署(INT8 / INT4)
✅ FastAPI 封装成接口
✅ vLLM / llama.cpp 移植
如果你愿意,可以告诉我:
我可以直接给你 最优部署方案 + 一键脚本。