sudo apt update
sudo apt install -y git python3-pip python3-venvpython3 -m venv openelm-env
source openelm-env/bin/activatepip install torch transformers acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "apple/OpenELM-270M-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto"
)
prompt = "What is Linux?"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
makemkdir models
cd models
# 从 Hugging Face 下载(示例)
wget https://huggingface.co/TheBloke/OpenELM-270M-Instruct-GGUF/resolve/main/openelm-270m-instruct.Q4_K_M.gguf./llama-cli \
-m models/openelm-270m-instruct.Q4_K_M.gguf \
-p "What is Linux?" \
-n 100curl -fsSL https://ollama.com/install.sh | shmkdir openelm-ollama && cd openelm-ollama
cat > Modelfile <ollama create openelm -f Modelfile
ollama run openelm "What is Linux?"device_map="auto")llama.cpp + 量化| 场景 | 推荐方式 |
|---|---|
| 快速体验 | Ollama |
| 生产/开发 | Transformers |
| 低资源/CPU | llama.cpp |
如果你需要 Docker 部署、API 服务化(FastAPI) 或 多卡推理,可以继续问我。