通用参数 (common params)

  • -h, –help, –usage
    显示帮助信息并退出。

  • –version
    显示版本及构建信息。

  • -cl, –cache-list
    列出缓存中的模型。

  • –completion-bash
    打印可被 source​ 的 bash 补全脚本,用于 llama.cpp

  • -t, –threads N
    生成时使用的 CPU 线程数。默认 -1​(自动,通常为可用核心数)。
    环境变量:LLAMA_ARG_THREADS

  • -tb, –threads-batch N
    批处理及提示处理时使用的线程数。默认与 --threads 相同。

  • -C, –cpu-mask M
    CPU 亲和性掩码,使用任意长度的十六进制。可与 --cpu-range 互补。默认为空。

  • -Cr, –cpu-range lo-hi
    CPU 亲和性范围(例如 0-3​)。可与 --cpu-mask 互补。

  • –cpu-strict <0|1>
    是否使用严格的 CPU 绑定(0=否,1=是)。默认 0。

  • –prio N
    进程/线程优先级:-1​低,0​正常,1​中,2​高,3实时。默认 0。

  • –poll <0…100>
    轮询级别,等待工作的轮询程度(0 不轮询,默认 50)。

  • -Cb, –cpu-mask-batch M
    批处理时的 CPU 亲和性掩码,默认同 --cpu-mask

  • -Crb, –cpu-range-batch lo-hi
    批处理时的 CPU 亲和性范围,默认同 --cpu-range

  • –cpu-strict-batch <0|1>
    批处理时是否严格 CPU 绑定,默认同 --cpu-strict

  • –prio-batch N
    批处理时的优先级:0​正常,1​中,2​高,3实时。默认 0。

  • –poll-batch <0|1>
    批处理时是否使用轮询,默认同 --poll

  • -c, –ctx-size N
    提示上下文大小(token 数量)。0 表示自动从模型加载。
    环境变量:LLAMA_ARG_CTX_SIZE

  • -n, –predict, –n-predict N
    要生成的 token 数量。-1​ 表示无限生成。
    环境变量:LLAMA_ARG_N_PREDICT

  • -b, –batch-size N
    逻辑最大批处理大小(默认 2048)。
    环境变量:LLAMA_ARG_BATCH

  • -ub, –ubatch-size N
    物理最大批处理大小(默认 512)。
    环境变量:LLAMA_ARG_UBATCH

  • –keep N
    保留初始提示中的前 N 个 token(-1 保留全部,默认 0)。

  • –swa-full
    使用完整大小的滑动窗口注意力缓存(默认关闭)。
    环境变量:LLAMA_ARG_SWA_FULL

  • -fa, –flash-attn [on|off|auto]
    闪存注意力(Flash Attention)开关。可选 on​、off​、auto​,默认 auto​。
    环境变量:LLAMA_ARG_FLASH_ATTN

  • -p, –prompt PROMPT
    直接指定用于生成的提示语。系统消息请用 -sys

  • –perf, –no-perf
    是否启用内部性能计时(默认关闭)。
    环境变量:LLAMA_ARG_PERF

  • -f, –file FNAME
    从文件读取提示内容(文本文件)。

  • -bf, –binary-file FNAME
    从二进制文件读取提示内容。

  • -e, –escape, –no-escape
    是否处理转义序列(如 \n​, \r​, \t 等)。默认启用。

  • –rope-scaling {none,linear,yarn}
    RoPE 频率缩放方法,默认为 linear​,除非模型另有指定。
    环境变量:LLAMA_ARG_ROPE_SCALING_TYPE

  • –rope-scale N
    RoPE 上下文缩放因子,将上下文扩展至原来的 N 倍。
    环境变量:LLAMA_ARG_ROPE_SCALE

  • –rope-freq-base N
    RoPE 基础频率,用于 NTK 感知缩放。默认从模型读取。
    环境变量:LLAMA_ARG_ROPE_FREQ_BASE

  • –rope-freq-scale N
    RoPE 频率缩放因子,将上下文扩展至原来的 1/N 倍。
    环境变量:LLAMA_ARG_ROPE_FREQ_SCALE

  • –yarn-orig-ctx N
    YaRN 缩放:模型的原始上下文大小(0 表示训练时的上下文大小)。
    环境变量:LLAMA_ARG_YARN_ORIG_CTX

  • –yarn-ext-factor N
    YaRN 外推混合因子(默认 -1.0,0.0 表示完全内插)。
    环境变量:LLAMA_ARG_YARN_EXT_FACTOR

  • –yarn-attn-factor N
    YaRN 注意力缩放因子(调整 sqrt(t)​ 或注意力幅度,默认 -1.0)。
    环境变量:LLAMA_ARG_YARN_ATTN_FACTOR

  • –yarn-beta-slow N
    YaRN 高维度修正参数(alpha,默认 -1.0)。
    环境变量:LLAMA_ARG_YARN_BETA_SLOW

  • –yarn-beta-fast N
    YaRN 低维度修正参数(beta,默认 -1.0)。
    环境变量:LLAMA_ARG_YARN_BETA_FAST

  • -kvo, –kv-offload, -nkvo, –no-kv-offload
    是否启用 KV 缓存卸载到 GPU。默认启用。
    环境变量:LLAMA_ARG_KV_OFFLOAD

  • –repack, -nr, –no-repack
    是否启用权重的重新打包(优化显存布局)。默认启用。
    环境变量:LLAMA_ARG_REPACK

  • –no-host
    绕过主机缓冲区,允许使用额外的缓冲区。
    环境变量:LLAMA_ARG_NO_HOST

  • -ctk, –cache-type-k TYPE
    KV 缓存中 K 的数据类型。可选:f32​, f16​, bf16​, q8_0​, q4_0​, q4_1​, iq4_nl​, q5_0​, q5_1​。默认 f16​。
    环境变量:LLAMA_ARG_CACHE_TYPE_K

  • -ctv, –cache-type-v TYPE
    KV 缓存中 V 的数据类型,选项同上,默认 f16​。
    环境变量:LLAMA_ARG_CACHE_TYPE_V

  • -dt, –defrag-thold N
    KV 缓存碎片整理阈值(已弃用)。
    环境变量:LLAMA_ARG_DEFRAG_THOLD

  • -np, –parallel N
    并行解码的序列数量。默认 1。
    环境变量:LLAMA_ARG_N_PARALLEL

  • –mlock
    锁定模型在内存中,防止换出/压缩。
    环境变量:LLAMA_ARG_MLOCK

  • –mmap, –no-mmap
    是否使用内存映射加载模型。禁用时加载稍慢,但可能减少页面换出(如果未使用 mlock​)。默认启用。
    环境变量:LLAMA_ARG_MMAP

  • -dio, –direct-io, -ndio, –no-direct-io
    是否使用 DirectIO(如果可用)。默认禁用。
    环境变量:LLAMA_ARG_DIO

  • –numa TYPE
    NUMA 优化尝试。

    • distribute:均匀分布所有节点;
    • isolate:仅使用启动所在节点的 CPU;
    • numactl​:使用 numactl​ 提供的 CPU 映射。
      建议之前未使用时先清空系统页面缓存。
      环境变量:LLAMA_ARG_NUMA
  • -dev, –device <dev1,dev2,..>
    用于模型卸载的设备列表(逗号分隔)。none​ 表示不卸载。用 --list-devices​ 查看可用设备。
    环境变量:LLAMA_ARG_DEVICE

  • –list-devices
    列出可用设备后退出。

  • -ot, –override-tensor =,…
    覆盖特定张量的缓冲区类型。
    环境变量:LLAMA_ARG_OVERRIDE_TENSOR

  • -cmoe, –cpu-moe
    将所有 MoE(混合专家)权重保留在 CPU 上。
    环境变量:LLAMA_ARG_CPU_MOE

  • -ncmoe, –n-cpu-moe N
    仅将前 N 层 MoE 权重保留在 CPU。
    环境变量:LLAMA_ARG_N_CPU_MOE

  • -ngl, –gpu-layers, –n-gpu-layers N
    允许存储到显存(VRAM)的最大层数。可以是具体数字、auto​ 或 all​。默认 auto​。
    环境变量:LLAMA_ARG_N_GPU_LAYERS

  • -sm, –split-mode {none,layer,row,tensor}
    多 GPU 分割模式。

    • none:仅使用一块 GPU;
    • layer(默认):按层分割,流水线处理;
    • row:跨 GPU 按行分拆权重(并行);
    • tensor​:跨 GPU 分拆权重与 KV(并行,实验性)。
      环境变量:LLAMA_ARG_SPLIT_MODE
  • -ts, –tensor-split N0,N1,N2,…
    模型卸载到各个 GPU 的比例,逗号分隔(例如 3,1​ 表示第一块 GPU 比例为 3/4)。
    环境变量:LLAMA_ARG_TENSOR_SPLIT

  • -mg, –main-gpu INDEX
    主 GPU 索引(split-mode=none​ 时作为模型所在 GPU;split-mode=row​ 时存放中间结果和 KV)。默认 0。
    环境变量:LLAMA_ARG_MAIN_GPU

  • -fit, –fit [on|off]
    是否自动调整未设置的参数以适应设备内存(默认 on​)。
    环境变量:LLAMA_ARG_FIT

  • -fitt, –fit-target MiB0,MiB1,MiB2,…
    --fit​ 的每个设备目标剩余内存(MiB),逗号分隔,若只给一个值则用于所有设备。默认 1024。
    环境变量:LLAMA_ARG_FIT_TARGET

  • -fitc, –fit-ctx N
    设置 --fit​ 允许的最小上下文大小,默认 4096。
    环境变量:LLAMA_ARG_FIT_CTX

  • –check-tensors
    检查模型张量数据是否包含非法值(默认关闭)。

  • –override-kv KEY=TYPE:VALUE,…
    高级选项,用于覆盖模型元数据。例如:tokenizer.ggml.add_bos_token=bool:false

  • –op-offload, –no-op-offload
    是否将主机张量操作卸载到设备(默认开启)。

  • –lora FNAME
    LoRA 适配器路径,多个用逗号分隔。

  • –lora-scaled FNAME:SCALE,…
    带缩放因子的 LoRA 适配器,格式 路径:缩放系数,多个用逗号分隔。

  • –control-vector FNAME
    添加控制向量,多个用逗号分隔。

  • –control-vector-scaled FNAME:SCALE,…
    带缩放的控制向量,格式 路径:缩放系数

  • –control-vector-layer-range START END
    应用控制向量的层范围(起始和结束都包含)。

  • -m, –model FNAME
    模型文件路径。
    环境变量:LLAMA_ARG_MODEL

  • -mu, –model-url MODEL_URL
    模型下载 URL(默认不使用)。
    环境变量:LLAMA_ARG_MODEL_URL

  • -dr, –docker-repo [/][:quant]
    Docker Hub 上的模型仓库。repo​ 可选,默认 ai/​;quant​ 可选,默认 :latest​。例如:gemma3​。
    环境变量:LLAMA_ARG_DOCKER_REPO

  • -hf, -hfr, –hf-repo /[:quant]
    Hugging Face 模型仓库。量化可选,大小写不敏感,默认 Q4_K_M​ 或仓库内首个文件。多模态投影文件(mmproj)也会自动下载,可通过 --no-mmproj​ 禁用。
    例如:ggml-org/GLM-4.7-Flash-GGUF:Q4_K_M
    环境变量:LLAMA_ARG_HF_REPO

  • -hff, –hf-file FILE
    Hugging Face 模型文件,若指定会覆盖 --hf-repo​ 的量化选择。
    环境变量:LLAMA_ARG_HF_FILE

  • -hfv, -hfrv, –hf-repo-v /[:quant]
    用于声码器模型的 Hugging Face 仓库。
    环境变量:LLAMA_ARG_HF_REPO_V

  • -hffv, –hf-file-v FILE
    用于声码器模型的 Hugging Face 文件。
    环境变量:LLAMA_ARG_HF_FILE_V

  • -hft, –hf-token TOKEN
    Hugging Face 访问令牌。默认取自 HF_TOKEN 环境变量。

  • –log-disable
    禁用日志。

  • –log-file FNAME
    日志输出到文件。
    环境变量:LLAMA_ARG_LOG_FILE

  • –log-colors [on|off|auto]
    日志彩色输出(默认 auto​,仅在终端时启用颜色)。
    环境变量:LLAMA_ARG_LOG_COLORS

  • -v, –verbose, –log-verbose
    设置日志详细程度为无限(记录所有消息,用于调试)。

  • –offline
    离线模式:强制使用缓存,禁止网络访问。
    环境变量:LLAMA_ARG_OFFLINE

  • -lv, –verbosity, –log-verbosity N
    设置日志详细阈值。高于此级别的消息被忽略。
    值:0=通用输出,1=错误,2=警告,3=信息,4=跟踪,5=调试。默认 1。
    环境变量:LLAMA_ARG_LOG_VERBOSITY

  • –log-prefix, –no-log-prefix
    是否在日志消息前显示前缀。
    环境变量:LLAMA_ARG_LOG_PREFIX

  • –log-timestamps, –no-log-timestamps
    是否在日志消息前添加时间戳。
    环境变量:LLAMA_ARG_LOG_TIMESTAMPS

  • –spec-draft-type-k, -ctkd, –cache-type-k-draft TYPE
    推测模型(draft model)的 K 缓存数据类型。可选值同 --cache-type-k​。默认 f16​。
    环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_K

  • –spec-draft-type-v, -ctvd, –cache-type-v-draft TYPE
    推测模型的 V 缓存数据类型。默认 f16​。
    环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_V


采样参数 (sampling params)

  • –samplers SAMPLERS
    生成时使用的采样器及顺序,以 ;​ 分隔。
    默认:penalties;dry;top_n_sigma;top_k;typ_p;top_p;min_p;xtc;temperature
  • -s, –seed SEED
    随机数种子。-1 表示随机种子。
  • –sampler-seq, –sampling-seq SEQUENCE
    简化版采样器序列,一个字符代表一个采样器。默认 edskypmxt(e=?, d=dry?, … 具体映射需看代码,这里不展开)。
    如果你需要了解每个字母含义,可以另外说明。
  • –ignore-eos
    忽略结束符,继续生成。等同于对 EOS token 设置极大的负 logit 偏置(--logit-bias EOS-inf)。
  • –temp, –temperature N
    温度参数,控制随机性。默认 0.80。数值越大输出越随机。
  • –top-k N
    Top-K 采样:只从概率最高的 K 个 token 中采样。0 禁用。默认 40。
    环境变量:LLAMA_ARG_TOP_K
  • –top-p N
    Top-P(核采样):累积概率达到 P 时截断。1.0 禁用。默认 0.95。
    环境变量:LLAMA_ARG_TOP_P
  • –min-p N
    Min-P 采样:将概率小于最高概率的 N 倍的 token 过滤掉。0.0 禁用。默认 0.05。
    环境变量:LLAMA_ARG_MIN_P
  • –top-nsigma, –top-n-sigma N
    Top-N-Sigma 采样:基于分布的均值/标准差截断。-1.0 禁用。默认 -1.0。
  • –xtc-probability N
    XTC 采样概率(默认 0.0,禁用)。
  • –xtc-threshold N
    XTC 阈值(默认 0.10,1.0 禁用)。
  • –typical, –typical-p N
    局部典型采样参数 p(默认 1.0,1.0 禁用)。
  • –repeat-last-n N
    用于惩罚的最近 N 个 token(0 禁用,-1 使用整个上下文)。默认 64。
  • –repeat-penalty N
    重复惩罚系数,>1 降低重复概率。1.0 禁用。默认 1.0。
  • –presence-penalty N
    存在性惩罚(alpha_presence),正值减少已在上下文中出现的 token 的概率。默认 0.0(禁用)。
  • –frequency-penalty N
    频率惩罚(alpha_frequency),正值惩罚高频 token。默认 0.0(禁用)。
  • –dry-multiplier N
    DRY 采样乘数(默认 0.0,禁用)。
  • –dry-base N
    DRY 采样基础值(默认 1.75)。
  • –dry-allowed-length N
    DRY 采样允许的重复长度(默认 2)。
  • –dry-penalty-last-n N
    DRY 惩罚作用的最后 N 个 token(-1 为整个上下文,0 禁用)。默认 -1。
  • –dry-sequence-breaker STRING
    添加 DRY 序列中断符,并清空默认中断符(\n​, :​, "​, *​)。使用 "none" 表示不使用任何中断符。
  • –adaptive-target N
    自适应采样(adaptive-p):选择接近此概率的 token。负值禁用。默认 -1.0。
  • –adaptive-decay N
    自适应采样衰减率,范围 0.0~0.99。低值更灵敏,高值更稳定。默认 0.90。
  • –dynatemp-range N
    动态温度范围(默认 0.0,禁用)。
  • –dynatemp-exp N
    动态温度指数(默认 1.00)。
  • –mirostat N
    Mirostat 采样。1 = Mirostat,2 = Mirostat 2.0,0 禁用。启用后 Top-K、核采样等会被忽略。默认 0。
  • –mirostat-lr N
    Mirostat 学习率(参数 η)。默认 0.10。
  • –mirostat-ent N
    Mirostat 目标熵(参数 τ)。默认 5.00。
  • -l, –logit-bias TOKEN_ID(+/-)BIAS
    修改特定 token 出现概率的偏置。如 15043+1​ 增加 token “ Hello” 的概率,15043-1 减少。
  • –grammar GRAMMAR
    BNF 风格语法,用于约束生成(示例见 grammars/ 目录)。
  • –grammar-file FNAME
    从文件读取语法约束。
  • -j, –json-schema SCHEMA
    JSON Schema 约束生成内容(如 {}​ 允许任意 JSON 对象)。需注意外部引用请改用 --grammar + 转换脚本。
  • -jf, –json-schema-file FILE
    从文件读取 JSON Schema 约束生成内容。
  • -bs, –backend-sampling
    启用后端采样(实验性)。默认禁用。
    环境变量:LLAMA_ARG_BACKEND_SAMPLING

推测解码参数 (speculative params)

  • –spec-draft-hf, -hfd, -hfrd, –hf-repo-draft /[:quant]
    推测模型(draft)的 Hugging Face 仓库,用法同 --hf-repo​。
    环境变量:LLAMA_ARG_SPEC_DRAFT_HF_REPO
  • –spec-draft-threads, -td, –threads-draft N
    推测模型生成时使用的线程数。默认同 --threads
  • –spec-draft-threads-batch, -tbd, –threads-batch-draft N
    推测模型批处理时的线程数。默认同 --spec-draft-threads
  • –spec-draft-cpu-mask, -Cd, –cpu-mask-draft M
    推测模型的 CPU 亲和性掩码,默认同 --cpu-mask
  • –spec-draft-cpu-range, -Crd, –cpu-range-draft lo-hi
    推测模型的 CPU 亲和性范围。
  • –spec-draft-cpu-strict, –cpu-strict-draft <0|1>
    推测模型是否严格 CPU 绑定,默认同 --cpu-strict
  • –spec-draft-prio, –prio-draft N
    推测模型线程优先级(0正常,1中,2高,3实时)。默认 0。
  • –spec-draft-poll, –poll-draft <0|1>
    推测模型是否使用轮询,默认同 --poll
  • –spec-draft-cpu-mask-batch, -Cbd, –cpu-mask-batch-draft M
    推测模型批处理时的 CPU 掩码,默认同 --cpu-mask
  • –spec-draft-cpu-strict-batch, –cpu-strict-batch-draft <0|1>
    推测模型批处理时严格 CPU 绑定,默认同 --spec-draft-cpu-strict
  • –spec-draft-prio-batch, –prio-batch-draft N
    推测模型批处理优先级,默认 0。
  • –spec-draft-poll-batch, –poll-batch-draft <0|1>
    推测模型批处理时轮询,默认同 --poll-draft
  • –spec-draft-override-tensor, -otd, –override-tensor-draft =,…
    覆盖推测模型的张量缓冲区类型。
  • –spec-draft-cpu-moe, -cmoed, –cpu-moe-draft
    将推测模型的所有 MoE 权重保留在 CPU。
    环境变量:LLAMA_ARG_SPEC_DRAFT_CPU_MOE
  • –spec-draft-n-cpu-moe, –spec-draft-ncmoe, -ncmoed, –n-cpu-moe-draft N
    将推测模型的前 N 层 MoE 权重保留在 CPU。
    环境变量:LLAMA_ARG_SPEC_DRAFT_N_CPU_MOE
  • –spec-draft-n-max N
    推测解码时一次草稿的最大 token 数。默认 3。
    环境变量:LLAMA_ARG_SPEC_DRAFT_N_MAX
  • –spec-draft-n-min N
    推测解码接受的最小草稿 token 数。默认 0。
    环境变量:LLAMA_ARG_SPEC_DRAFT_N_MIN
  • –spec-draft-p-split, –draft-p-split P
    推测解码分割概率。默认 0.10。
    环境变量:LLAMA_ARG_SPEC_DRAFT_P_SPLIT
  • –spec-draft-p-min, –draft-p-min P
    推测解码最小概率(贪婪阈值)。默认 0.0。
    环境变量:LLAMA_ARG_SPEC_DRAFT_P_MIN
  • –spec-draft-backend-sampling, –no-spec-draft-backend-sampling
    是否将推测模型的采样卸载到后端。默认启用。
    环境变量:LLAMA_ARG_SPEC_DRAFT_BACKEND_SAMPLING
  • –spec-draft-device, -devd, –device-draft <dev1,dev2,..>
    推测模型卸载设备列表。使用 --list-devices 查看可用设备。
  • –spec-draft-ngl, -ngld, –gpu-layers-draft, –n-gpu-layers-draft N
    推测模型存储在 VRAM 的最大层数。可选数字、auto​、all​。默认 auto​。
    环境变量:LLAMA_ARG_N_GPU_LAYERS_DRAFT
  • –spec-draft-model, -md, –model-draft FNAME
    推测模型的模型文件路径。
    环境变量:LLAMA_ARG_SPEC_DRAFT_MODEL
  • –spec-type none,draft-simple,draft-eagle3,draft-mtp,ngram-simple,ngram-map-k,ngram-map-k4v,ngram-mod,ngram-cache
    要使用的推测解码类型,逗号分隔。默认 none​。
    环境变量:LLAMA_ARG_SPEC_TYPE
  • –spec-ngram-mod-n-min N
    基于 ngram 的推测解码(ngram-mod)的最小 ngram token 数。默认 48。
  • –spec-ngram-mod-n-max N
    基于 ngram 的推测解码(ngram-mod)的最大 ngram token 数。默认 64。
  • –spec-ngram-mod-n-match N
    基于 ngram 的推测解码(ngram-mod)的查找长度。默认 24。
  • –spec-ngram-simple-size-n N
    ngram-simple 推测解码的 n-gram 大小(查找长度)。默认 12。
  • –spec-ngram-simple-size-m N
    ngram-simple 推测解码的草稿 m-gram 大小。默认 48。
  • –spec-ngram-simple-min-hits N
    ngram-simple 推测解码的最小命中次数。默认 1。
  • –spec-ngram-map-k-size-n N
    ngram-map-k 推测解码的 n-gram 查找长度。默认 12。
  • –spec-ngram-map-k-size-m N
    ngram-map-k 推测解码的草稿 m-gram 大小。默认 48。
  • –spec-ngram-map-k-min-hits N
    ngram-map-k 推测解码的最小命中次数。默认 1。
  • –spec-ngram-map-k4v-size-n N
    ngram-map-k4v 推测解码的 n-gram 查找长度。默认 12。
  • –spec-ngram-map-k4v-size-m N
    ngram-map-k4v 推测解码的草稿 m-gram 大小。默认 48。
  • –spec-ngram-map-k4v-min-hits N
    ngram-map-k4v 推测解码的最小命中次数。默认 1。
  • –draft, –draft-n, –draft-max N
    已移除,请使用 --spec-draft-n-max​ 或 --spec-ngram-mod-n-max​。
    环境变量:LLAMA_ARG_DRAFT_MAX
  • –draft-min, –draft-n-min N
    已移除,请使用 --spec-draft-n-min​ 或 --spec-ngram-mod-n-min​。
    环境变量:LLAMA_ARG_DRAFT_MIN

示例/交互相关参数 (example-specific params)

  • –verbose-prompt
    生成前打印详细提示信息(默认关闭)。

  • –display-prompt, –no-display-prompt
    是否在生成时显示提示内容。默认显示。

  • -co, –color [on|off|auto]
    输出着色,区分提示、用户输入和生成内容。默认 auto(终端时自动着色)。

  • -ctxcp, –ctx-checkpoints, –swa-checkpoints N
    每个槽位最多创建的上下文检查点数。默认 32。
    环境变量:LLAMA_ARG_CTX_CHECKPOINTS

  • -cram, –cache-ram N
    设置最大缓存大小(MiB)。-1​ 无限制,0​ 禁用。默认 8192。
    环境变量:LLAMA_ARG_CACHE_RAM

  • –context-shift, –no-context-shift
    是否在无限文本生成时使用上下文移动(默认禁用)。
    环境变量:LLAMA_ARG_CONTEXT_SHIFT

  • -sys, –system-prompt PROMPT
    系统提示词(如果模型支持,取决于聊天模板)。

  • –show-timings, –no-show-timings
    是否每次回复后显示计时信息。默认显示。
    环境变量:LLAMA_ARG_SHOW_TIMINGS

  • -sysf, –system-prompt-file FNAME
    从文件读取系统提示词。

  • -r, –reverse-prompt PROMPT
    当生成内容中出现该提示时停止生成,返回控制权(交互模式)。

  • -sp, –special
    输出特殊 token(如 ​、</s> 等)。默认不输出。

  • -cnv, –conversation, -no-cnv, –no-conversation
    是否以对话模式运行:不打印特殊 token 和后缀/前缀,同时自动启用交互模式。默认:当聊天模板可用时自动启用。

  • -st, –single-turn
    单轮对话:仅执行一轮后退出。如果使用 --prompt 预填充了首轮提示,则不会进入交互。默认关闭。

  • -mli, –multiline-input
    允许输入多行(比如粘贴多行文本),无需行尾加 \

  • –warmup, –no-warmup
    是否执行预热(空推理一次)。默认启用。

  • -mm, –mmproj FILE
    多模态投影文件路径(视觉等)。见 tools/mtmd/README.md​。若使用了 -hf​ 会自动下载,此参数可省略。
    环境变量:LLAMA_ARG_MMPROJ

  • -mmu, –mmproj-url URL
    多模态投影文件的下载 URL。
    环境变量:LLAMA_ARG_MMPROJ_URL

  • –mmproj-auto, –no-mmproj, –no-mmproj-auto
    是否自动使用多模态投影文件(如果可用),在使用 -hf​ 时很有用。默认启用。
    环境变量:LLAMA_ARG_MMPROJ_AUTO

  • –mmproj-offload, –no-mmproj-offload
    是否将多模态投影卸载到 GPU。默认启用。
    环境变量:LLAMA_ARG_MMPROJ_OFFLOAD

  • –image, –audio, –video FILE
    多模态输入文件路径(图像、音频、视频)。多个文件用逗号分隔。

  • –image-min-tokens N
    每张图像可用的最小 token 数(仅用于支持动态分辨率的视觉模型)。默认从模型读取。
    环境变量:LLAMA_ARG_IMAGE_MIN_TOKENS

  • –image-max-tokens N
    每张图像可用的最大 token 数。默认从模型读取。
    环境变量:LLAMA_ARG_IMAGE_MAX_TOKENS

  • –chat-template-kwargs STRING
    设置传递给 JSON 模板解析器的额外参数,必须是合法的 JSON 对象字符串,例如 '{"key1":"value1","key2":"value2"}'​。
    环境变量:LLAMA_ARG_CHAT_TEMPLATE_KWARGS

  • –jinja, –no-jinja
    是否使用 Jinja 模板引擎处理对话。默认启用。
    环境变量:LLAMA_ARG_JINJA

  • –reasoning-format FORMAT
    控制如何处理思考标签以及提取格式。可选:

    • none​:思考内容保留在 message.content 中;
    • deepseek​:将思考内容放入 message.reasoning_content
    • deepseek-legacy:保留 :