1 下载模型modelscope download --model cyankiwi/Qwen3.8-27B-AWQ-INT4 --local_dir H:\agent\trt-llm\models\qwen3.8-27b-awq为什么这个 AWQ 不是 14GB 而是21GB因为作者对 Qwen3.8 敏感的Gated DeltaNet 状态更新层和因果卷积保留了 BF16 高精度仅对占体积最大的注意力与 FFN 进行了 INT4 压缩即W4A16 混合精度从而确保模型不会失真这 21GB 权重载入显存后占用约21~22 GB正好可以压着极限完全吃满你的单张 RTX 309024GB2 开代理拉dockerdocker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev2026091700003 建立容器docker run -it --gpus all --ipchost --ulimit memlock-1 --ulimit stack67108864 -p 8000:8000 -v H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model --name trt-qwen38 nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev202609170000 bash4 模型trtllm-serve /model --backend pytorch --host 0.0.0.0 --port 8000 是什么意思核心结论TRT-LLM 1.3.0 目前尚未支持 INT4 的compressed-tensors。我们来看刚才第 125~135 行的源码# 源码中明确写着 else: raise ValueError( fUnsupported quant_bits: {weights_quant_config[num_bits]}. Supported: 8 (FP8) or 4 (NVFP4). )TRT-LLM 1.3.0 刚刚合入对compressed-tensors的实验性支持目前只支持 8-bit (FP8) 和 4-bit 浮点 (NVFP4 / MXFP4)还没有实现 INT4整数量化。root8486ae1773b2:/app/tensorrt_llm# python3 -c import tensorrt_llm.models as m; print([x for x in dir(m) if Qwen in x]) Skipping import of cpp extensions due to incompatible torch version 2.14.0a04fdf77b940.nv26.08 for torchao version 0.15.0 Please see https://github.com/pytorch/ao/issues/2919 for more info [TensorRT-LLM] TensorRT LLM version: 1.3.0rc27.dev202609170000 []真相大白TRT-LLM 对 Qwen3.8 根本没有“纯 C 引擎”你之所以觉得 TRT-LLM 快是因为你之前跑 Qwen2.5-14B 时用的是trtllm-build编译出来的纯 C.engine。但根据刚刚所有的源码检测TRT-LLM 1.3.0 并没有为 Qwen3.8 编写 C Engine 编译器所以tensorrt_llm.models查出来是空的[]。NVIDIA 对 Qwen3.8 的支持全部扔在了一个叫_torch的Python 后端里。换句话说在 TRT-LLM 里跑 Qwen3.8本质上和 vLLM 一样也是走 Python 调度根本享受不到纯 C 引擎的狂暴速度而且还缺少 INT4 开源解包算子最优解决方案直接用 vLLM 运行该模型无需重新下载任何权重直接用我们刚才下好的H:\agent\qwen38\...目录。第一步退出当前 TRT 容器在当前容器终端执行退出exit第二步在宿主机 Windows PowerShell 一键启动 vLLM如果需要拉取镜像请保持本地代理开启docker run -d --gpus all --ipchost -p 8000:8000 -v H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model --name vllm-qwen38 vllm/vllm-openai:latest --model /model --gpu-memory-utilization 0.90 --max-model-len 4096第三步查看启动与加载日志docker logs -f vllm-qwen38vLLM 会直接识别compressed-tensors并加载 Marlin INT4 内核。看到Application startup complete后即可直接调用
