Skip to main content

模型推理

geniex pull

下载模型并存储到本地。
从本地路径拉取:
pull 会将文件复制到 GenieX 缓存。拉取成功后可安全删除源文件,避免保留两份副本。
精度(量化)(仅 llama.cpp) 对于 GGUF 模型,CLI 会提示选择精度:
Q4_0 在 Hexagon NPU 上支持最佳。详见支持的精度(量化)
Qualcomm AI Hub 模型已预量化——无需选择。

geniex infer — LLM

启动与语言模型的交互式对话。
思考模式——控制模型是否在回复前展示推理过程:
计算单元选择(通过 --compute)——选择运行模型的计算单元(默认:npu):
Qualcomm AI Hub 模型仅在 NPU 上运行。使用 --compute cpu--compute gpu 会返回错误。

geniex infer — VLM

运行视觉语言模型推理,支持纯文本或图像输入:
如果只需文本输入,直接启动并对话即可。若要使用图像输入,请提供绝对路径或将图片文件直接拖入终端:

geniex serve

启动兼容 OpenAI 协议的本地服务器。API 详见本地服务器
要把思考模型的思维链从 message.content 移到 message.reasoning_content,在单次请求中设置 reasoning_format 字段即可——详见分离推理内容

日志

--log 是全局标志,控制 CLI 的日志输出。它与 GENIEX_LOG 环境变量等效,且当二者同时设置时优先于 GENIEX_LOG

配置标志

以下标志可传给 geniex infer,用于控制模型加载与生成行为。

采样器标志

控制模型在生成时如何选择 token。

模型标志

控制模型加载、上下文与生成限制。

增大上下文长度

上下文窗口(--nctx)是模型一次能容纳的内容上限。当对话增长超过该上限时会报 context length exceeded 错误。如何增大取决于运行时:
  • llama.cpp (GGUF): --nctx <N> 可在运行时抬升窗口,上限为模型训练时的最大值。窗口越大,占用的 KV 缓存内存越多。
  • Qualcomm AI Engine Direct (NPU): 上下文长度固化在编译好的模型包中,运行时无法抬升——--nctx 不生效。可改用:

实用命令