llama-cli 参数配置指南
通用参数 (common params)
-h, –help, –usage
显示帮助信息并退出。–version
显示版本及构建信息。-cl, –cache-list
列出缓存中的模型。–completion-bash
打印可被source 的 bash 补全脚本,用于llama.cpp。-t, –threads N
生成时使用的 CPU 线程数。默认-1(自动,通常为可用核心数)。
环境变量:LLAMA_ARG_THREADS-tb, –threads-batch N
批处理及提示处理时使用的线程数。默认与--threads相同。-C, –cpu-mask M
CPU 亲和性掩码,使用任意长度的十六进制。可与--cpu-range互补。默认为空。-Cr, –cpu-range lo-hi
CPU 亲和性范围(例如0-3)。可与--cpu-mask互补。–cpu-strict <0|1>
是否使用严格的 CPU 绑定(0=否,1=是)。默认 0。–prio N
进程/线程优先级:-1低,0正常,1中,2高,3实时。默认 0。–poll <0…100>
轮询级别,等待工作的轮询程度(0 不轮询,默认 50)。-Cb, –cpu-mask-batch M
批处理时的 CPU 亲和性掩码,默认同--cpu-mask。-Crb, –cpu-range-batch lo-hi
批处理时的 CPU 亲和性范围,默认同--cpu-range。–cpu-strict-batch <0|1>
批处理时是否严格 CPU 绑定,默认同--cpu-strict。–prio-batch N
批处理时的优先级:0正常,1中,2高,3实时。默认 0。–poll-batch <0|1>
批处理时是否使用轮询,默认同--poll。-c, –ctx-size N
提示上下文大小(token 数量)。0 表示自动从模型加载。
环境变量:LLAMA_ARG_CTX_SIZE-n, –predict, –n-predict N
要生成的 token 数量。-1 表示无限生成。
环境变量:LLAMA_ARG_N_PREDICT-b, –batch-size N
逻辑最大批处理大小(默认 2048)。
环境变量:LLAMA_ARG_BATCH-ub, –ubatch-size N
物理最大批处理大小(默认 512)。
环境变量:LLAMA_ARG_UBATCH–keep N
保留初始提示中的前 N 个 token(-1保留全部,默认 0)。–swa-full
使用完整大小的滑动窗口注意力缓存(默认关闭)。
环境变量:LLAMA_ARG_SWA_FULL-fa, –flash-attn [on|off|auto]
闪存注意力(Flash Attention)开关。可选on、off、auto,默认auto。
环境变量:LLAMA_ARG_FLASH_ATTN-p, –prompt PROMPT
直接指定用于生成的提示语。系统消息请用-sys。–perf, –no-perf
是否启用内部性能计时(默认关闭)。
环境变量:LLAMA_ARG_PERF-f, –file FNAME
从文件读取提示内容(文本文件)。-bf, –binary-file FNAME
从二进制文件读取提示内容。-e, –escape, –no-escape
是否处理转义序列(如\n,\r,\t等)。默认启用。–rope-scaling {none,linear,yarn}
RoPE 频率缩放方法,默认为linear,除非模型另有指定。
环境变量:LLAMA_ARG_ROPE_SCALING_TYPE–rope-scale N
RoPE 上下文缩放因子,将上下文扩展至原来的 N 倍。
环境变量:LLAMA_ARG_ROPE_SCALE–rope-freq-base N
RoPE 基础频率,用于 NTK 感知缩放。默认从模型读取。
环境变量:LLAMA_ARG_ROPE_FREQ_BASE–rope-freq-scale N
RoPE 频率缩放因子,将上下文扩展至原来的 1/N 倍。
环境变量:LLAMA_ARG_ROPE_FREQ_SCALE–yarn-orig-ctx N
YaRN 缩放:模型的原始上下文大小(0 表示训练时的上下文大小)。
环境变量:LLAMA_ARG_YARN_ORIG_CTX–yarn-ext-factor N
YaRN 外推混合因子(默认 -1.0,0.0 表示完全内插)。
环境变量:LLAMA_ARG_YARN_EXT_FACTOR–yarn-attn-factor N
YaRN 注意力缩放因子(调整sqrt(t) 或注意力幅度,默认 -1.0)。
环境变量:LLAMA_ARG_YARN_ATTN_FACTOR–yarn-beta-slow N
YaRN 高维度修正参数(alpha,默认 -1.0)。
环境变量:LLAMA_ARG_YARN_BETA_SLOW–yarn-beta-fast N
YaRN 低维度修正参数(beta,默认 -1.0)。
环境变量:LLAMA_ARG_YARN_BETA_FAST-kvo, –kv-offload, -nkvo, –no-kv-offload
是否启用 KV 缓存卸载到 GPU。默认启用。
环境变量:LLAMA_ARG_KV_OFFLOAD–repack, -nr, –no-repack
是否启用权重的重新打包(优化显存布局)。默认启用。
环境变量:LLAMA_ARG_REPACK–no-host
绕过主机缓冲区,允许使用额外的缓冲区。
环境变量:LLAMA_ARG_NO_HOST-ctk, –cache-type-k TYPE
KV 缓存中 K 的数据类型。可选:f32,f16,bf16,q8_0,q4_0,q4_1,iq4_nl,q5_0,q5_1。默认f16。
环境变量:LLAMA_ARG_CACHE_TYPE_K-ctv, –cache-type-v TYPE
KV 缓存中 V 的数据类型,选项同上,默认f16。
环境变量:LLAMA_ARG_CACHE_TYPE_V-dt, –defrag-thold N
KV 缓存碎片整理阈值(已弃用)。
环境变量:LLAMA_ARG_DEFRAG_THOLD-np, –parallel N
并行解码的序列数量。默认 1。
环境变量:LLAMA_ARG_N_PARALLEL–mlock
锁定模型在内存中,防止换出/压缩。
环境变量:LLAMA_ARG_MLOCK–mmap, –no-mmap
是否使用内存映射加载模型。禁用时加载稍慢,但可能减少页面换出(如果未使用mlock)。默认启用。
环境变量:LLAMA_ARG_MMAP-dio, –direct-io, -ndio, –no-direct-io
是否使用 DirectIO(如果可用)。默认禁用。
环境变量:LLAMA_ARG_DIO–numa TYPE
NUMA 优化尝试。-
distribute:均匀分布所有节点; -
isolate:仅使用启动所在节点的 CPU; -
numactl:使用numactl 提供的 CPU 映射。
建议之前未使用时先清空系统页面缓存。
环境变量:LLAMA_ARG_NUMA
-
-dev, –device <dev1,dev2,..>
用于模型卸载的设备列表(逗号分隔)。none 表示不卸载。用--list-devices 查看可用设备。
环境变量:LLAMA_ARG_DEVICE–list-devices
列出可用设备后退出。-ot, –override-tensor
= ,…
覆盖特定张量的缓冲区类型。
环境变量:LLAMA_ARG_OVERRIDE_TENSOR-cmoe, –cpu-moe
将所有 MoE(混合专家)权重保留在 CPU 上。
环境变量:LLAMA_ARG_CPU_MOE-ncmoe, –n-cpu-moe N
仅将前 N 层 MoE 权重保留在 CPU。
环境变量:LLAMA_ARG_N_CPU_MOE-ngl, –gpu-layers, –n-gpu-layers N
允许存储到显存(VRAM)的最大层数。可以是具体数字、auto 或all。默认auto。
环境变量:LLAMA_ARG_N_GPU_LAYERS-sm, –split-mode {none,layer,row,tensor}
多 GPU 分割模式。-
none:仅使用一块 GPU; -
layer(默认):按层分割,流水线处理; -
row:跨 GPU 按行分拆权重(并行); -
tensor:跨 GPU 分拆权重与 KV(并行,实验性)。
环境变量:LLAMA_ARG_SPLIT_MODE
-
-ts, –tensor-split N0,N1,N2,…
模型卸载到各个 GPU 的比例,逗号分隔(例如3,1 表示第一块 GPU 比例为 3/4)。
环境变量:LLAMA_ARG_TENSOR_SPLIT-mg, –main-gpu INDEX
主 GPU 索引(split-mode=none 时作为模型所在 GPU;split-mode=row 时存放中间结果和 KV)。默认 0。
环境变量:LLAMA_ARG_MAIN_GPU-fit, –fit [on|off]
是否自动调整未设置的参数以适应设备内存(默认on)。
环境变量:LLAMA_ARG_FIT-fitt, –fit-target MiB0,MiB1,MiB2,…
--fit 的每个设备目标剩余内存(MiB),逗号分隔,若只给一个值则用于所有设备。默认 1024。
环境变量:LLAMA_ARG_FIT_TARGET-fitc, –fit-ctx N
设置--fit 允许的最小上下文大小,默认 4096。
环境变量:LLAMA_ARG_FIT_CTX–check-tensors
检查模型张量数据是否包含非法值(默认关闭)。–override-kv KEY=TYPE:VALUE,…
高级选项,用于覆盖模型元数据。例如:tokenizer.ggml.add_bos_token=bool:false。–op-offload, –no-op-offload
是否将主机张量操作卸载到设备(默认开启)。–lora FNAME
LoRA 适配器路径,多个用逗号分隔。–lora-scaled FNAME:SCALE,…
带缩放因子的 LoRA 适配器,格式路径:缩放系数,多个用逗号分隔。–control-vector FNAME
添加控制向量,多个用逗号分隔。–control-vector-scaled FNAME:SCALE,…
带缩放的控制向量,格式路径:缩放系数。–control-vector-layer-range START END
应用控制向量的层范围(起始和结束都包含)。-m, –model FNAME
模型文件路径。
环境变量:LLAMA_ARG_MODEL-mu, –model-url MODEL_URL
模型下载 URL(默认不使用)。
环境变量:LLAMA_ARG_MODEL_URL-dr, –docker-repo [
/] [:quant]
Docker Hub 上的模型仓库。repo 可选,默认ai/;quant 可选,默认:latest。例如:gemma3。
环境变量:LLAMA_ARG_DOCKER_REPO-hf, -hfr, –hf-repo
/ [:quant]
Hugging Face 模型仓库。量化可选,大小写不敏感,默认Q4_K_M 或仓库内首个文件。多模态投影文件(mmproj)也会自动下载,可通过--no-mmproj 禁用。
例如:ggml-org/GLM-4.7-Flash-GGUF:Q4_K_M
环境变量:LLAMA_ARG_HF_REPO-hff, –hf-file FILE
Hugging Face 模型文件,若指定会覆盖--hf-repo 的量化选择。
环境变量:LLAMA_ARG_HF_FILE-hfv, -hfrv, –hf-repo-v
/ [:quant]
用于声码器模型的 Hugging Face 仓库。
环境变量:LLAMA_ARG_HF_REPO_V-hffv, –hf-file-v FILE
用于声码器模型的 Hugging Face 文件。
环境变量:LLAMA_ARG_HF_FILE_V-hft, –hf-token TOKEN
Hugging Face 访问令牌。默认取自HF_TOKEN环境变量。–log-disable
禁用日志。–log-file FNAME
日志输出到文件。
环境变量:LLAMA_ARG_LOG_FILE–log-colors [on|off|auto]
日志彩色输出(默认auto,仅在终端时启用颜色)。
环境变量:LLAMA_ARG_LOG_COLORS-v, –verbose, –log-verbose
设置日志详细程度为无限(记录所有消息,用于调试)。–offline
离线模式:强制使用缓存,禁止网络访问。
环境变量:LLAMA_ARG_OFFLINE-lv, –verbosity, –log-verbosity N
设置日志详细阈值。高于此级别的消息被忽略。
值:0=通用输出,1=错误,2=警告,3=信息,4=跟踪,5=调试。默认 1。
环境变量:LLAMA_ARG_LOG_VERBOSITY–log-prefix, –no-log-prefix
是否在日志消息前显示前缀。
环境变量:LLAMA_ARG_LOG_PREFIX–log-timestamps, –no-log-timestamps
是否在日志消息前添加时间戳。
环境变量:LLAMA_ARG_LOG_TIMESTAMPS–spec-draft-type-k, -ctkd, –cache-type-k-draft TYPE
推测模型(draft model)的 K 缓存数据类型。可选值同--cache-type-k。默认f16。
环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_K–spec-draft-type-v, -ctvd, –cache-type-v-draft TYPE
推测模型的 V 缓存数据类型。默认f16。
环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_V
采样参数 (sampling params)
- –samplers SAMPLERS
生成时使用的采样器及顺序,以; 分隔。
默认:penalties;dry;top_n_sigma;top_k;typ_p;top_p;min_p;xtc;temperature - -s, –seed SEED
随机数种子。-1表示随机种子。 - –sampler-seq, –sampling-seq SEQUENCE
简化版采样器序列,一个字符代表一个采样器。默认edskypmxt(e=?, d=dry?, … 具体映射需看代码,这里不展开)。
如果你需要了解每个字母含义,可以另外说明。 - –ignore-eos
忽略结束符,继续生成。等同于对 EOS token 设置极大的负 logit 偏置(--logit-bias EOS-inf)。 - –temp, –temperature N
温度参数,控制随机性。默认 0.80。数值越大输出越随机。 - –top-k N
Top-K 采样:只从概率最高的 K 个 token 中采样。0 禁用。默认 40。
环境变量:LLAMA_ARG_TOP_K - –top-p N
Top-P(核采样):累积概率达到 P 时截断。1.0 禁用。默认 0.95。
环境变量:LLAMA_ARG_TOP_P - –min-p N
Min-P 采样:将概率小于最高概率的 N 倍的 token 过滤掉。0.0 禁用。默认 0.05。
环境变量:LLAMA_ARG_MIN_P - –top-nsigma, –top-n-sigma N
Top-N-Sigma 采样:基于分布的均值/标准差截断。-1.0禁用。默认 -1.0。 - –xtc-probability N
XTC 采样概率(默认 0.0,禁用)。 - –xtc-threshold N
XTC 阈值(默认 0.10,1.0 禁用)。 - –typical, –typical-p N
局部典型采样参数 p(默认 1.0,1.0 禁用)。 - –repeat-last-n N
用于惩罚的最近 N 个 token(0 禁用,-1 使用整个上下文)。默认 64。 - –repeat-penalty N
重复惩罚系数,>1 降低重复概率。1.0 禁用。默认 1.0。 - –presence-penalty N
存在性惩罚(alpha_presence),正值减少已在上下文中出现的 token 的概率。默认 0.0(禁用)。 - –frequency-penalty N
频率惩罚(alpha_frequency),正值惩罚高频 token。默认 0.0(禁用)。 - –dry-multiplier N
DRY 采样乘数(默认 0.0,禁用)。 - –dry-base N
DRY 采样基础值(默认 1.75)。 - –dry-allowed-length N
DRY 采样允许的重复长度(默认 2)。 - –dry-penalty-last-n N
DRY 惩罚作用的最后 N 个 token(-1 为整个上下文,0 禁用)。默认 -1。 - –dry-sequence-breaker STRING
添加 DRY 序列中断符,并清空默认中断符(\n,:,",*)。使用"none"表示不使用任何中断符。 - –adaptive-target N
自适应采样(adaptive-p):选择接近此概率的 token。负值禁用。默认 -1.0。 - –adaptive-decay N
自适应采样衰减率,范围 0.0~0.99。低值更灵敏,高值更稳定。默认 0.90。 - –dynatemp-range N
动态温度范围(默认 0.0,禁用)。 - –dynatemp-exp N
动态温度指数(默认 1.00)。 - –mirostat N
Mirostat 采样。1 = Mirostat,2 = Mirostat 2.0,0 禁用。启用后 Top-K、核采样等会被忽略。默认 0。 - –mirostat-lr N
Mirostat 学习率(参数 η)。默认 0.10。 - –mirostat-ent N
Mirostat 目标熵(参数 τ)。默认 5.00。 - -l, –logit-bias TOKEN_ID(+/-)BIAS
修改特定 token 出现概率的偏置。如15043+1 增加 token “ Hello” 的概率,15043-1减少。 - –grammar GRAMMAR
BNF 风格语法,用于约束生成(示例见grammars/目录)。 - –grammar-file FNAME
从文件读取语法约束。 - -j, –json-schema SCHEMA
JSON Schema 约束生成内容(如{} 允许任意 JSON 对象)。需注意外部引用请改用--grammar+ 转换脚本。 - -jf, –json-schema-file FILE
从文件读取 JSON Schema 约束生成内容。 - -bs, –backend-sampling
启用后端采样(实验性)。默认禁用。
环境变量:LLAMA_ARG_BACKEND_SAMPLING
推测解码参数 (speculative params)
- –spec-draft-hf, -hfd, -hfrd, –hf-repo-draft
/ [:quant]
推测模型(draft)的 Hugging Face 仓库,用法同--hf-repo。
环境变量:LLAMA_ARG_SPEC_DRAFT_HF_REPO - –spec-draft-threads, -td, –threads-draft N
推测模型生成时使用的线程数。默认同--threads。 - –spec-draft-threads-batch, -tbd, –threads-batch-draft N
推测模型批处理时的线程数。默认同--spec-draft-threads。 - –spec-draft-cpu-mask, -Cd, –cpu-mask-draft M
推测模型的 CPU 亲和性掩码,默认同--cpu-mask。 - –spec-draft-cpu-range, -Crd, –cpu-range-draft lo-hi
推测模型的 CPU 亲和性范围。 - –spec-draft-cpu-strict, –cpu-strict-draft <0|1>
推测模型是否严格 CPU 绑定,默认同--cpu-strict。 - –spec-draft-prio, –prio-draft N
推测模型线程优先级(0正常,1中,2高,3实时)。默认 0。 - –spec-draft-poll, –poll-draft <0|1>
推测模型是否使用轮询,默认同--poll。 - –spec-draft-cpu-mask-batch, -Cbd, –cpu-mask-batch-draft M
推测模型批处理时的 CPU 掩码,默认同--cpu-mask。 - –spec-draft-cpu-strict-batch, –cpu-strict-batch-draft <0|1>
推测模型批处理时严格 CPU 绑定,默认同--spec-draft-cpu-strict。 - –spec-draft-prio-batch, –prio-batch-draft N
推测模型批处理优先级,默认 0。 - –spec-draft-poll-batch, –poll-batch-draft <0|1>
推测模型批处理时轮询,默认同--poll-draft。 - –spec-draft-override-tensor, -otd, –override-tensor-draft
= ,…
覆盖推测模型的张量缓冲区类型。 - –spec-draft-cpu-moe, -cmoed, –cpu-moe-draft
将推测模型的所有 MoE 权重保留在 CPU。
环境变量:LLAMA_ARG_SPEC_DRAFT_CPU_MOE - –spec-draft-n-cpu-moe, –spec-draft-ncmoe, -ncmoed, –n-cpu-moe-draft N
将推测模型的前 N 层 MoE 权重保留在 CPU。
环境变量:LLAMA_ARG_SPEC_DRAFT_N_CPU_MOE - –spec-draft-n-max N
推测解码时一次草稿的最大 token 数。默认 3。
环境变量:LLAMA_ARG_SPEC_DRAFT_N_MAX - –spec-draft-n-min N
推测解码接受的最小草稿 token 数。默认 0。
环境变量:LLAMA_ARG_SPEC_DRAFT_N_MIN - –spec-draft-p-split, –draft-p-split P
推测解码分割概率。默认 0.10。
环境变量:LLAMA_ARG_SPEC_DRAFT_P_SPLIT - –spec-draft-p-min, –draft-p-min P
推测解码最小概率(贪婪阈值)。默认 0.0。
环境变量:LLAMA_ARG_SPEC_DRAFT_P_MIN - –spec-draft-backend-sampling, –no-spec-draft-backend-sampling
是否将推测模型的采样卸载到后端。默认启用。
环境变量:LLAMA_ARG_SPEC_DRAFT_BACKEND_SAMPLING - –spec-draft-device, -devd, –device-draft <dev1,dev2,..>
推测模型卸载设备列表。使用--list-devices查看可用设备。 - –spec-draft-ngl, -ngld, –gpu-layers-draft, –n-gpu-layers-draft N
推测模型存储在 VRAM 的最大层数。可选数字、auto、all。默认auto。
环境变量:LLAMA_ARG_N_GPU_LAYERS_DRAFT - –spec-draft-model, -md, –model-draft FNAME
推测模型的模型文件路径。
环境变量:LLAMA_ARG_SPEC_DRAFT_MODEL - –spec-type none,draft-simple,draft-eagle3,draft-mtp,ngram-simple,ngram-map-k,ngram-map-k4v,ngram-mod,ngram-cache
要使用的推测解码类型,逗号分隔。默认none。
环境变量:LLAMA_ARG_SPEC_TYPE - –spec-ngram-mod-n-min N
基于 ngram 的推测解码(ngram-mod)的最小 ngram token 数。默认 48。 - –spec-ngram-mod-n-max N
基于 ngram 的推测解码(ngram-mod)的最大 ngram token 数。默认 64。 - –spec-ngram-mod-n-match N
基于 ngram 的推测解码(ngram-mod)的查找长度。默认 24。 - –spec-ngram-simple-size-n N
ngram-simple 推测解码的 n-gram 大小(查找长度)。默认 12。 - –spec-ngram-simple-size-m N
ngram-simple 推测解码的草稿 m-gram 大小。默认 48。 - –spec-ngram-simple-min-hits N
ngram-simple 推测解码的最小命中次数。默认 1。 - –spec-ngram-map-k-size-n N
ngram-map-k 推测解码的 n-gram 查找长度。默认 12。 - –spec-ngram-map-k-size-m N
ngram-map-k 推测解码的草稿 m-gram 大小。默认 48。 - –spec-ngram-map-k-min-hits N
ngram-map-k 推测解码的最小命中次数。默认 1。 - –spec-ngram-map-k4v-size-n N
ngram-map-k4v 推测解码的 n-gram 查找长度。默认 12。 - –spec-ngram-map-k4v-size-m N
ngram-map-k4v 推测解码的草稿 m-gram 大小。默认 48。 - –spec-ngram-map-k4v-min-hits N
ngram-map-k4v 推测解码的最小命中次数。默认 1。 - –draft, –draft-n, –draft-max N
已移除,请使用--spec-draft-n-max 或--spec-ngram-mod-n-max。
环境变量:LLAMA_ARG_DRAFT_MAX - –draft-min, –draft-n-min N
已移除,请使用--spec-draft-n-min 或--spec-ngram-mod-n-min。
环境变量:LLAMA_ARG_DRAFT_MIN
示例/交互相关参数 (example-specific params)
–verbose-prompt
生成前打印详细提示信息(默认关闭)。–display-prompt, –no-display-prompt
是否在生成时显示提示内容。默认显示。-co, –color [on|off|auto]
输出着色,区分提示、用户输入和生成内容。默认auto(终端时自动着色)。-ctxcp, –ctx-checkpoints, –swa-checkpoints N
每个槽位最多创建的上下文检查点数。默认 32。
环境变量:LLAMA_ARG_CTX_CHECKPOINTS-cram, –cache-ram N
设置最大缓存大小(MiB)。-1 无限制,0 禁用。默认 8192。
环境变量:LLAMA_ARG_CACHE_RAM–context-shift, –no-context-shift
是否在无限文本生成时使用上下文移动(默认禁用)。
环境变量:LLAMA_ARG_CONTEXT_SHIFT-sys, –system-prompt PROMPT
系统提示词(如果模型支持,取决于聊天模板)。–show-timings, –no-show-timings
是否每次回复后显示计时信息。默认显示。
环境变量:LLAMA_ARG_SHOW_TIMINGS-sysf, –system-prompt-file FNAME
从文件读取系统提示词。-r, –reverse-prompt PROMPT
当生成内容中出现该提示时停止生成,返回控制权(交互模式)。-sp, –special
输出特殊 token(如 、</s>等)。默认不输出。-cnv, –conversation, -no-cnv, –no-conversation
是否以对话模式运行:不打印特殊 token 和后缀/前缀,同时自动启用交互模式。默认:当聊天模板可用时自动启用。-st, –single-turn
单轮对话:仅执行一轮后退出。如果使用--prompt预填充了首轮提示,则不会进入交互。默认关闭。-mli, –multiline-input
允许输入多行(比如粘贴多行文本),无需行尾加\。–warmup, –no-warmup
是否执行预热(空推理一次)。默认启用。-mm, –mmproj FILE
多模态投影文件路径(视觉等)。见tools/mtmd/README.md。若使用了-hf 会自动下载,此参数可省略。
环境变量:LLAMA_ARG_MMPROJ-mmu, –mmproj-url URL
多模态投影文件的下载 URL。
环境变量:LLAMA_ARG_MMPROJ_URL–mmproj-auto, –no-mmproj, –no-mmproj-auto
是否自动使用多模态投影文件(如果可用),在使用-hf 时很有用。默认启用。
环境变量:LLAMA_ARG_MMPROJ_AUTO–mmproj-offload, –no-mmproj-offload
是否将多模态投影卸载到 GPU。默认启用。
环境变量:LLAMA_ARG_MMPROJ_OFFLOAD–image, –audio, –video FILE
多模态输入文件路径(图像、音频、视频)。多个文件用逗号分隔。–image-min-tokens N
每张图像可用的最小 token 数(仅用于支持动态分辨率的视觉模型)。默认从模型读取。
环境变量:LLAMA_ARG_IMAGE_MIN_TOKENS–image-max-tokens N
每张图像可用的最大 token 数。默认从模型读取。
环境变量:LLAMA_ARG_IMAGE_MAX_TOKENS–chat-template-kwargs STRING
设置传递给 JSON 模板解析器的额外参数,必须是合法的 JSON 对象字符串,例如'{"key1":"value1","key2":"value2"}'。
环境变量:LLAMA_ARG_CHAT_TEMPLATE_KWARGS–jinja, –no-jinja
是否使用 Jinja 模板引擎处理对话。默认启用。
环境变量:LLAMA_ARG_JINJA–reasoning-format FORMAT
控制如何处理思考标签以及提取格式。可选:-
none:思考内容保留在message.content中; -
deepseek:将思考内容放入message.reasoning_content; -
deepseek-legacy:保留 :
-




