OpenELM 是 Apple 开源的一系列小参数 LLM(如 270M / 450M / 1.1B / 3B),特点是:
conda create -n openelm python=3.10
conda activate openelm
pip install torch transformers accelerate有 GPU 建议安装 CUDA 版本 PyTorch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "apple/OpenELM-1_1B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto"
)
prompt = "What is OpenELM?"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
output = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(output[0], skip_special_tokens=True))git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make需要先用 transformers 导出为 GGUF(社区已有脚本)
或直接使用社区转换好的 GGUF 模型(HuggingFace 搜索 OpenELM gguf)
./main -m openelm-1_1b.Q4_K_M.gguf -p "Hello"ollama run openelm若官方未收录,可自定义 Modelfile
from fastapi import FastAPI
from transformers import pipeline
app = FastAPI()
generator = pipeline("text-generation", model="apple/OpenELM-1_1B")
@app.post("/generate")
def generate(text: str):
return generator(text, max_new_tokens=100)启动:
uvicorn main:app --host 0.0.0.0 --port 8000如果你告诉我:
我可以直接给你最优部署方案 + 命令。