OpenELM 是 Apple 开源的高效语言模型系列(270M–3B),支持:
官方仓库:
https://github.com/apple/corenetconda create -n openelm python=3.10 -y
conda activate openelm或用 venv:
python3 -m venv openelm
source openelm/bin/activategit clone https://github.com/apple/corenet
cd corenet
pip install -e .pip install torch transformers accelerate sentencepiece示例(1.1B):
apple/OpenELM-1_1B
apple/OpenELM-3B
apple/OpenELM-270Mfrom transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "apple/OpenELM-1_1B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto"
)
prompt = "What is OpenELM?"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))pip install fastapi uvicornapp.py
from fastapi import FastAPI
from transformers import AutoModelForCausalLM, AutoTokenizer
app = FastAPI()
model = AutoModelForCausalLM.from_pretrained("apple/OpenELM-1_1B", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("apple/OpenELM-1_1B")
@app.post("/generate")
def generate(text: str):
inputs = tokenizer(text, return_tensors="pt").to("cuda")
out = model.generate(**inputs, max_new_tokens=100)
return tokenizer.decode(out[0], skip_special_tokens=True)启动:
uvicorn app:app --host 0.0.0.0 --port 8000pip install vllmpython -m vllm.entrypoints.api_server \
--model apple/OpenELM-1_1B✅ CPU 能跑吗?
能,但慢,建议 ≤ 270M
✅ 显存需求
✅ 不能直接从 transformers 加载?
我可以直接给你专属部署命令或 Docker 方案。