控制生成的随机性/创造性。
| 温度值 | 适用场景 |
|---|---|
| 0.0 | 事实问答、代码生成、数学推理(确定性) |
| 0.3–0.7 | 通用对话、摘要、翻译 |
| 0.8–1.2 | 创意写作、故事生成 |
| >1.2 | 高随机性,通常不推荐 |
✅ 最佳实践:
控制累积概率阈值,避免低概率 token。
| Top‑P | 说明 |
|---|---|
| 1.0 | 不限制 |
| 0.9 | 常用、稳定 |
| 0.7–0.8 | 更保守 |
| <0.7 | 容易重复或死板 |
✅ 建议:
限制每次只从概率最高的 K 个 token 中选。
| Top‑K | 场景 |
|---|---|
| 0(关闭) | 推荐 |
| 40–50 | 文本生成 |
| 10–20 | 强约束任务 |
✅ 建议:
防止生成重复内容。
| 值 | 效果 |
|---|---|
| 1.0 | 无惩罚 |
| 1.1–1.2 | 推荐 |
| >1.3 | 可能导致语句不通 |
✅ 建议:
控制输出长度。
✅ 建议:
Temperature = 0.0
Top-P = 1.0
Top-K = 0
Repetition Penalty = 1.0
Max Tokens = 512Temperature = 0.6
Top-P = 0.9
Top-K = 0
Repetition Penalty = 1.1
Max Tokens = 512Temperature = 0.9
Top-P = 0.9
Top-K = 0
Repetition Penalty = 1.1
Max Tokens = 1024Temperature = 0.3
Top-P = 0.9
Repetition Penalty = 1.15
Max Tokens = 512| 模式 | 场景 |
|---|---|
| Greedy | 确定性任务 |
| Sampling | 通用 |
| Beam Search | 翻译、摘要(不常用) |
✅ 推荐:
对输出质量影响极大。
✅ 示例:
你是一个严谨的技术助手,回答要简洁、准确,不发散。| 精度 | 说明 |
|---|---|
| FP16 | 高质量 |
| INT8 | 平衡 |
| 4-bit | 低显存 |
最佳推理参数 = 正确任务类型 + 最低 Temperature + 合理长度 + 稳定采样策略
如果你愿意,可以告诉我:
我可以直接给你一套即插即用的参数配置。