Llama 3 模型(由 Meta 发布)的上下文长度依赖具体版本,常见情况如下:
1. 官方基础版本
- Llama 3 8B / 70B(原始版):上下文长度 8K tokens(约 6,000~7,000 汉字,或约 6,000 英文单词)。
- Llama 3.1 8B / 70B / 405B:上下文长度 128K tokens(大幅提升,可处理超长文档、长对话、代码库等)。
2. 社区扩展版本
很多团队通过位置编码扩展、长上下文微调等方式,把 Llama 3 的上下文进一步拉长,例如:
- 部分 8B/70B 微调版支持 32K、64K 甚至更长(如 CodeLlama 部分版本、LongLlama 等)。
- 实际可用长度还受显存/推理框架限制(长上下文对显存要求更高)。
3. 实际可用长度参考
| 模型 | 官方上下文 | 实际可用(中文) | 典型场景 |
|---|
| Llama 3 8B/70B | 8K | ~6K 汉字 | 短对话、短文生成 |
| Llama 3.1 全系列 | 128K | ~100K 汉字 | 长文档分析、代码库理解 |
| 社区长上下文版 | 32K~128K+ | 更长 | 论文、书籍、长代码 |
4. 注意
- Token 不是字数:中文通常 1 个汉字 ≈ 1.5~2 tokens,英文 1 个单词 ≈ 1.3 tokens。
- 推理时:即使模型支持 128K,实际部署也可能因显存限制而缩短有效长度。
- 不同实现:Ollama、vLLM、Transformers 等框架对长上下文的支持程度不同。
如果你有具体使用场景(比如“分析 2 万字报告”或“跑代码仓库”),可以告诉我,我可以帮你判断该选哪个版本、怎么部署。