模型推理
geniex pull
下载模型并存储到本地。
从本地路径拉取:
pull 会将文件复制到 GenieX 缓存。拉取成功后可安全删除源文件,避免保留两份副本。geniex infer — LLM
启动与语言模型的交互式对话。
--compute)——选择运行模型的计算单元(默认:npu):
geniex infer — VLM
运行视觉语言模型推理,支持纯文本或图像输入:
geniex serve
启动兼容 OpenAI 协议的本地服务器。API 详见本地服务器。
message.content 移到 message.reasoning_content,在单次请求中设置 reasoning_format 字段即可——详见分离推理内容。
日志
--log 是全局标志,控制 CLI 的日志输出。它与 GENIEX_LOG 环境变量等效,且当二者同时设置时优先于 GENIEX_LOG。
配置标志
以下标志可传给geniex infer,用于控制模型加载与生成行为。
采样器标志
控制模型在生成时如何选择 token。模型标志
控制模型加载、上下文与生成限制。增大上下文长度
上下文窗口(--nctx)是模型一次能容纳的内容上限。当对话增长超过该上限时会报 context length exceeded 错误。如何增大取决于运行时:
-
llama.cpp (GGUF):
--nctx <N>可在运行时抬升窗口,上限为模型训练时的最大值。窗口越大,占用的 KV 缓存内存越多。 -
Qualcomm AI Engine Direct (NPU): 上下文长度固化在编译好的模型包中,运行时无法抬升——
--nctx不生效。可改用:- 加
--sliding-window以在超限后继续对话:驱逐锚定前缀之外最旧的上下文,而不是报错。 - 如需真正更大的窗口,请从 Qualcomm AI Hub 获取按更长上下文编译的模型包。参见 Qualcomm AI Engine Direct 运行环境限制。
- 加
实用命令
Was this page helpful?