- Qualcomm AI Hub —— Qualcomm AI Engine Direct 的预编译模型包,以及面向 llama.cpp 的精选 GGUF 模型。
- Hugging Face —— llama.cpp 可运行的任意 GGUF 模型。详见运行 Hugging Face 上的 GGUF 模型。
运行 Qualcomm AI Hub 模型
对于ai-hub-models/* 命名空间下的模型,直接输入 geniex infer 即可:
windows
Qualcomm AI Engine Direct 仅支持 NPU。传入
--compute npu 或省略该标志。运行 Hugging Face 上的 GGUF 模型
Hugging Face 上任意兼容的 GGUF 仓库都可以使用。复制仓库路径并传给geniex infer:
windows
windows
- 模型类型 —— 视觉-语言模型(Qwen3-VL 系列)选
vlm,其他选llm。 - 精度(量化) ——
Q4_0在 Hexagon NPU 上支持最佳。详见支持的精度(量化)。
设置 Hugging Face 令牌
Hugging Face 上的部分模型是受限模型(gated)——你需要在 Hugging Face 网站上接受模型许可协议,并提供访问令牌,GenieX 才能下载它们。1
创建令牌
前往 huggingface.co/settings/tokens,创建一个具有 Read 权限的新令牌。
2
接受模型许可协议
访问模型的 Hugging Face 页面(例如
https://huggingface.co/<org>/<model>),如有提示请接受许可/协议。3
向 GenieX 提供令牌
GenieX 按以下顺序检查令牌来源(使用第一个非空值):方式 B —— Hugging Face CLI 登录(持久化到磁盘):该命令会将令牌写入
GENIEX_HFTOKEN环境变量HF_TOKEN环境变量~/.cache/huggingface/token文件
~/.cache/huggingface/token,GenieX 会自动读取。运行本地 Qualcomm AI Engine Direct 模型包
ai-hub-models/* 命名空间之外的模型包——无论是从 Hugging Face 自行转换,还是已经存放在磁盘上——都只需导入一次,之后即可像任何其他模型一样运行。
- CLI
- Python
- Android
用 已在磁盘上将 也可以直接从 AI Hub
geniex pull --local-path 注册模型包,然后用 geniex infer 运行。从 Hugging Face 自行转换确保已安装 Hugging Face CLI,然后下载模型包并拉取:--local-path 指向已解压的模型包目录(包含 .bin 分片和 metadata.json):.zip 压缩包拉取,无需先解压:geniex pull 会将模型文件复制到本地缓存。拉取成功后,可以安全删除原始下载文件以释放磁盘空间。使用 geniex list 确认模型已缓存。运行本地 GGUF 模型
本地 GGUF 模型是一个保存.gguf 权重的目录(或文件)——可能是旁加载的、由其他工具生成的,或已经存放在磁盘上。导入一次后,即可像任何其他模型一样运行。
- CLI
- Python
- Android
将
--local-path 指向包含 .gguf 文件的目录:支持的精度(量化)
所选精度决定模型运行在哪个计算平台。llama.cpp
llama.cpp 支持 GGML 全部量化格式。运行geniex pull 拉取 GGUF 模型时,CLI 会提示你选择其中之一:
Qualcomm AI Engine Direct
Qualcomm AI Engine Direct 模型包已静态预量化——该运行环境没有精度选择。如需不同精度,请从 Qualcomm AI Hub 获取另一个模型包。
其他模型包约束(上下文长度、KV 缓存、Android
nCtx)参见 Qualcomm AI Engine Direct 运行环境限制。
Was this page helpful?