AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载TensorRT-LLM 是 NVIDIA 开源的 LLM 推理优化库专为在 NVIDIA GPUA100、H100、GB200上榨取极限吞吐与最低延迟而设计。本指南以 12-inference-serving/tensorrt-llm/SKILL.md 为核心骨架融合仓库内三份深度参考文档optimization.md、multi-gpu.md、serving.md系统讲解快速上手、量化FP8/INT4、In-Flight Batching、Paged KV Cache、推测解码、多 GPU 并行扩展以及面向生产的 OpenAI 兼容 API 与 Kubernetes 部署。读完你将从零掌握一条从「单卡验证」到「多节点生产服务」的完整 TensorRT-LLM 落地路径。一、何时选择 TensorRT-LLM选型决策与适用边界TensorRT-LLM 在仓库的 Skill 目录 中被定位为「NVIDIA 最快推理方案」其在 README 的 Inference Serving 分类中与 vLLM、llama.cpp、SGLang 并列见 README.md是 AI 研究 Agent 在推理服务阶段的四大武器之一。适用 TensorRT-LLM 的场景部署在 NVIDIA GPUA100、H100、GB200上追求极限性能需要最大吞吐如 Llama 3 达到 24,000 tokens/sec对实时应用要求低延迟使用量化模型FP8、INT4、FP4需要跨多 GPU 或多节点扩展。改用 vLLM 的场景需要更简单的安装和 Python 优先 API想要 PagedAttention 但不想经历 TensorRT 编译过程使用 AMD GPU 或非 NVIDIA 硬件。改用 llama.cpp 的场景在 CPU 或 Apple Silicon 上部署需要无 NVIDIA GPU 的边缘部署偏好更简单的 GGUF 量化格式。二、快速开始安装与首次推理2.1 安装环境SKILL.md 提供了三种安装路径# Docker推荐 docker pull nvidia/tensorrt_llm:latest # pip install pip install tensorrt_llm1.2.0rc3 # 环境要求CUDA 13.0.0、TensorRT 10.13.2、Python 3.10-3.12需要特别说明的是pip 方式对环境有严格版本约束CUDA 13.0.0、TensorRT 10.13.2、Python 3.10–3.12而 Docker 镜像自带完整依赖栈是生产环境更稳妥的选择。SKILL 的元数据SKILL.md 头部 frontmatter声明其依赖为tensorrt-llm与torch这也印证了离线推理时它与 PyTorch 生态的衔接关系。2.2 基础推理LLM SamplingParamsTensorRT-LLM 的 Python API 风格与 PyTorch 生态一脉相承核心是LLM对象与SamplingParamsfrom tensorrt_llm import LLM, SamplingParams # 初始化模型 llm LLM(modelmeta-llama/Meta-Llama-3-8B) # 配置采样 sampling_params SamplingParams( max_tokens100, temperature0.7, top_p0.9 ) # 生成 prompts [Explain quantum computing] outputs llm.generate(prompts, sampling_params) for output in outputs: print(output.text)关键点LLM(model...)会自动完成模型下载与 TensorRT 引擎编译SamplingParams中的temperature与top_p控制采样随机性max_tokens限制生成长度。2.3 一键服务trtllm-servetrtllm-serve是 SKILL.md 推荐的零配置服务入口自动完成模型下载与编译并暴露 OpenAI 兼容 API# 启动服务自动下载模型并编译 trtllm-serve meta-llama/Meta-Llama-3-8B \ --tp_size 4 \ # 张量并行4 张 GPU --max_batch_size 256 \ --max_num_tokens 4096 # 客户端请求 curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: meta-llama/Meta-Llama-3-8B, messages: [{role: user, content: Hello!}], temperature: 0.7, max_tokens: 100 }这里--tp_size 4表示将模型切分到 4 张 GPU张量并行--max_batch_size控制最大并发序列数--max_num_tokens限制单批总 token 数三者是吞吐调优的核心旋钮。三、核心特性全景SKILL.md 将 TensorRT-LLM 的性能优势归纳为三大板块3.1 性能优化技术In-Flight Batching飞行中批处理生成过程中动态合并请求而非等待所有序列结束吞吐可提升 4–8 倍Paged KV Cache分页 KV 缓存像操作系统管理虚拟内存一样管理 KV 缓存消除碎片吞吐提升 40–60%Flash Attention闪存注意力优化的注意力内核量化QuantizationFP8、INT4、FP4 带来 2–4 倍推理加速CUDA GraphsCUDA 图通过录制 GPU 操作降低内核启动开销。3.2 并行策略张量并行TP横向切分模型层到多 GPU单次前向、低延迟要求同节点 NVLink流水线并行PP按层纵向切分适合 175B 超大模型与跨节点场景专家并行EP面向 Mixture-of-ExpertsMoE模型如 Mixtral、DeepSeek-V2分发专家多节点Multi-node通过 Ray 或 Kubernetes 突破单机限制。3.3 高级能力推测解码Speculative Decoding用小型草稿模型预生成多 token再由目标模型并行验证长生成提速 2–3 倍LoRA 服务高效的多适配器部署解耦服务Disaggregated Serving将 prefill 与 generation 分离到不同实例。四、常见实战模式Common Patterns4.1 FP8 量化模型FP8 是 H100 上的推荐默认SKILL.md 称之为「2× 加速、50% 内存」from tensorrt_llm import LLM # 加载 FP8 量化模型2× 加速内存减半 llm LLM( modelmeta-llama/Meta-Llama-3-70B, dtypefp8, max_num_tokens8192 ) # 推理用法与之前完全一致 outputs llm.generate([Summarize this article...])4.2 多 GPU 部署# 跨 8 张 GPU 张量并行 llm LLM( modelmeta-llama/Meta-Llama-3-405B, tensor_parallel_size8, dtypefp8 )4.3 批量推理# 高效处理 100 条提示词 prompts [fQuestion {i}: ... for i in range(100)] outputs llm.generate( prompts, sampling_paramsSamplingParams(max_tokens200) ) # In-Flight Batching 自动生效最大化吞吐4.4 性能基准仓库记录Meta Llama 3-8BH100 GPU吞吐24,000 tokens/sec延迟每 token 约 10ms相比 PyTorch100× 加速Llama 3-70B8× A100 80GBFP8 量化比 FP16 快 2×FP8 内存占用减少 50%以上数据均源自仓库文档记录SKILL.md实际数值会随 GPU 型号、批大小与工作负载波动建议部署前用仓库提供的 benchmark 脚本实测。五、深度优化指南从默认到极限optimization.md 提供了 SKILL.md 之外的系统化优化方法论本节逐项展开。5.1 量化体系与对比FP8H100 推荐2× 推理加速、内存减半、困惑度劣化 1%llm LLM( modelmeta-llama/Meta-Llama-3-70B, dtypefp8, quantizationfp8 )实测参考Llama 3-70B on 8× H100FP16 为 5,000 tokens/secFP8 提升到10,000 tokens/sec内存从 140GB 降至 70GB。INT4最大压缩内存降 4×、推理快 3–4×支持 AWQ 与 GPTQ 两种校准路线# INT4 AWQ 校准 llm LLM( modelmeta-llama/Meta-Llama-3-405B, dtypeint4_awq, quantizationawq ) # INT4 GPTQ 校准 llm LLM( modelmeta-llama/Meta-Llama-3-405B, dtypeint4_gptq, quantizationgptq )量化方式对比表完整继承自 optimization.md方法内存速度精度使用场景FP161×基线1×最佳高精度需求FP80.5×2×-0.5% pplH100 默认INT4 AWQ0.25×3-4×-1.5% ppl内存紧张INT4 GPTQ0.25×3-4×-2% ppl极限速度5.2 In-Flight Batching动态批处理核心思想生成过程中动态合并请求而不是等所有序列结束。服务端配置如下trtllm-serve meta-llama/Meta-Llama-3-8B \ --max_batch_size 256 \ # 最大并发序列数 --max_num_tokens 4096 \ # 批内总 token 数 --enable_chunked_context \ # 切分长提示词 --scheduler_policy max_utilization性能影响吞吐比静态批处理高4–8×混合负载下 P50/P99 延迟更低GPU 利用率从 40–60% 提升到80–95%。5.3 Paged KV Cache分页式 KV 缓存将 KV 缓存内存管理类比 OS 的虚拟内存分页吞吐提升 40–60%、无内存碎片、支持更长序列。默认自动启用可调参数llm LLM( modelmeta-llama/Meta-Llama-3-8B, kv_cache_free_gpu_mem_fraction0.9, # 用 90% 显存做缓存 enable_prefix_cachingTrue # 缓存公共前缀 )5.4 推测解码Speculative Decoding用小型草稿模型一次预测多个 token目标模型并行验证# 目标模型Llama 3-70B llm LLM( modelmeta-llama/Meta-Llama-3-70B, speculative_modelmeta-llama/Meta-Llama-3-8B, # 草稿模型 num_speculative_tokens5 # 提前预测的 token 数 ) # API 用法不变长生成提速 2-3× outputs llm.generate(prompts)推荐的草稿模型组合同族、小 8–10 倍Target Llama 3-70B → Draft Llama 3-8BTarget Qwen2-72B → Draft Qwen2-7B。5.5 CUDA Graphs、Chunked Context 与 Overlap SchedulingCUDA Graphs录制 GPU 操作减少内核启动开销延迟降低 10–20%、P99 更稳定小批场景收益明显默认开启llm LLM( modelmeta-llama/Meta-Llama-3-8B, enable_cuda_graphTrue, # 默认: True cuda_graph_cache_size2 # 缓存 2 种图变体 )Chunked Context将超长提示词8K tokens切块处理降低显存尖峰trtllm-serve meta-llama/Meta-Llama-3-8B \ --max_num_tokens 4096 \ --enable_chunked_context \ --max_chunked_prefill_length 2048 # 每次处理 2K tokenOverlap Scheduling重叠计算与内存操作吞吐提升 15–25%v1.2.0 默认自动启用无需配置。5.6 调优工作流Tuning Workflowoptimization.md 给出了五步渐进式调优路线从默认开始llm LLM(modelmeta-llama/Meta-Llama-3-70B)H100 开启 FP8llm LLM(model..., dtypefp8)调批大小逐步增大直到 OOM再回退 20%trtllm-serve ... --max_batch_size 256长提示词开启 chunked context--enable_chunked_context --max_chunked_prefill_length 2048延迟敏感场景尝试推测解码llm LLM(model..., speculative_model...)5.7 基准测试与常见问题# 安装基准工具 pip install tensorrt_llm[benchmark] # 运行基准 python benchmarks/python/benchmark.py \ --model meta-llama/Meta-Llama-3-8B \ --batch_size 64 \ --input_len 128 \ --output_len 256 \ --dtype fp8需要跟踪的指标吞吐tokens/sec、P50/P90/P99 延迟ms、GPU 显存GB、GPU 利用率%。常见问题速查完整继承自 optimization.md现象对策OOM 错误降低max_batch_size/max_num_tokens启用 INT4增大tensor_parallel_size吞吐低增大max_batch_size确认 in-flight batching 生效核查 CUDA graphs检查 GPU 利用率延迟高尝试推测解码降低max_batch_size减少排队用 FP8 替代 FP16六、多 GPU 与多节点部署multi-gpu.md 系统梳理了从单卡到 405B 多节点的扩展路径。6.1 三大并行策略张量并行TP模型能装入多卡总显存但装不进单卡时使用延迟接近单卡、吞吐随卡数近似线性、层间激活同步通信开销高必须同节点 NVLinkllm LLM( modelmeta-llama/Meta-Llama-3-70B, tensor_parallel_size4, # 跨 4 张 GPU dtypefp16 )流水线并行PP适合 175B 超大规模或跨节点延迟更高但通信量低于 TPllm LLM( modelmeta-llama/Meta-Llama-3-405B, tensor_parallel_size4, # 节点内 TP4 pipeline_parallel_size2, # 跨节点 PP2 dtypefp8 ) # 总卡数: 84×2Layers 0-40 在节点 1Layers 41-80 在节点 2专家并行EP面向 MoE 模型分发专家llm LLM( modelmistralai/Mixtral-8x22B, tensor_parallel_size4, expert_parallel_size2, # 8 个专家分到 2 组 dtypefp8 )6.2 分级配置模板完整继承小模型7–13B单卡# Llama 3-8B on 1× A100 80GB llm LLM( modelmeta-llama/Meta-Llama-3-8B, dtypefp16 # H100 用 fp8 )资源参考1× A100 80GB约 16GB 模型 30GB KV 缓存吞吐 3,000–5,000 tokens/sec。中模型70B同节点多卡# Llama 3-70B on 4× A100 80GBNVLink llm LLM( modelmeta-llama/Meta-Llama-3-70B, tensor_parallel_size4, dtypefp8 # 70GB → 每卡 35GB )资源参考每卡约 35GBFP8吞吐 10,000–15,000 tokens/sec每 token 延迟 15–20ms。大模型405B多节点# Llama 3-405B on 2 节点 × 8 H100 16 GPU llm LLM( modelmeta-llama/Meta-Llama-3-405B, tensor_parallel_size8, # 节点内 TP pipeline_parallel_size2, # 跨节点 PP dtypefp8 )资源参考每卡约 25GBFP8吞吐 20,000–30,000 tokens/sec推荐 InfiniBand 网络。6.3 服务端多卡与多节点# 单节点多卡自动 TP trtllm-serve meta-llama/Meta-Llama-3-70B \ --tp_size 4 \ --max_batch_size 256 \ --dtype fp8 # 监听 http://localhost:8000 # 多节点 Ray ray start --head --port6379 # 节点 1head ray start --addressnode1:6379 # 节点 2worker trtllm-serve meta-llama/Meta-Llama-3-405B \ --tp_size 8 \ --pp_size 2 \ --num_workers 2 \ # 2 个节点 --dtype fp8Kubernetes 多卡部署申领 4 张 GPUapiVersion: apps/v1 kind: Deployment metadata: name: tensorrt-llm-llama3-70b spec: replicas: 1 template: spec: containers: - name: trtllm image: nvidia/tensorrt_llm:latest command: - trtllm-serve - meta-llama/Meta-Llama-3-70B - --tp_size4 - --max_batch_size256 resources: limits: nvidia.com/gpu: 4 # 请求 4 张 GPU6.4 并行度决策树完整继承模型 20GB? ├─ 是单 GPU无需并行 └─ 否模型 80GB? ├─ 是TP2 或 TP4同节点 └─ 否模型 320GB? ├─ 是TP4 或 TP8同节点需 NVLink └─ 否TP8 PP2多节点6.5 通信优化与监控NVLinkDGX A100 600 GB/s、HGX H100 900 GB/sTP 首选所有多卡配置推荐PCIe 4.0 x1664 GB/s比 NVLink 慢约 10×应避免 TP、改用 PPHDR InfiniBand200 Gb/s、延迟 1μs多节点 TP/PP 必备405B 模型至关重要。监控命令与指标nvidia-smi dmon -s u # GPU 利用率 nvidia-smi dmon -s m # 显存 nvidia-smi nvlink --status # NVLink 利用率 nvidia-smi topo -m # 验证 NVLink 拓扑 curl http://localhost:8000/metrics # 内置指标关键指标目标GPU 利用率 80–95%各卡显存均衡TP 下 NVLink 流量高、PP 下低。扩展效率实测表完整继承自 multi-gpu.mdTP 扩展Llama 3-70BFP8GPU 数TP Size吞吐延迟效率11OOM--226,000 tok/s18ms85%4411,000 tok/s16ms78%8818,000 tok/s15ms64%PP 扩展Llama 3-405BFP8节点数TPPP总 GPU吞吐1818OOM2821625,000 tok/s4843245,000 tok/s注意GPU 增多时通信开销使效率下降这是多卡扩展的固有规律。多卡最佳实践优先 TP延迟低TP 必配 NVLink多节点必配 InfiniBand从能装下模型的最小 TP 起步持续监控各卡利用率是否均衡上线前用基准测试验证H100 上使用 FP8 获得 2× 加速。七、生产级服务部署serving.md 将服务能力分为两种模式并覆盖了监控、弹性与安全的完整闭环。7.1 两种服务模式模式一trtllm-serve推荐—— OpenAI 兼容 API、自动下载编译、内置负载均衡、Prometheus 指标、健康检查trtllm-serve meta-llama/Meta-Llama-3-70B \ --tp_size 4 \ --dtype fp8 \ --max_batch_size 256 \ --max_num_tokens 4096 \ --enable_chunked_context \ --scheduler_policy max_utilization \ --port 8000 \ --api_key $API_KEY # 可选鉴权模式二Python LLM API嵌入现有服务—— 封装为类并接入 FastAPI 等 Web 框架from tensorrt_llm import LLM class LLMService: def __init__(self): self.llm LLM( modelmeta-llama/Meta-Llama-3-8B, dtypefp8 ) def generate(self, prompt, max_tokens100): from tensorrt_llm import SamplingParams params SamplingParams( max_tokensmax_tokens, temperature0.7 ) outputs self.llm.generate([prompt], params) return outputs[0].text # 接入 FastAPI from fastapi import FastAPI app FastAPI() service LLMService() app.post(/generate) def generate(prompt: str): return {response: service.generate(prompt)}7.2 OpenAI 兼容 API 全协议Chat Completionscurl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: meta-llama/Meta-Llama-3-8B, messages: [ {role: system, content: You are a helpful assistant.}, {role: user, content: Explain quantum computing} ], temperature: 0.7, max_tokens: 500, stream: false }标准响应结构含 usage 统计{ id: chat-abc123, object: chat.completion, created: 1234567890, model: meta-llama/Meta-Llama-3-8B, choices: [{ index: 0, message: { role: assistant, content: Quantum computing is... }, finish_reason: stop }], usage: { prompt_tokens: 25, completion_tokens: 150, total_tokens: 175 } }流式输出SSEcurl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: meta-llama/Meta-Llama-3-8B, messages: [{role: user, content: Count to 10}], stream: true }SSE 响应示例data: {choices:[{delta:{content:1}}]} data: {choices:[{delta:{content:, 2}}]} data: {choices:[{delta:{content:, 3}}]} data: [DONE]Completions补全curl -X POST http://localhost:8000/v1/completions \ -H Content-Type: application/json \ -d { model: meta-llama/Meta-Llama-3-8B, prompt: The capital of France is, max_tokens: 10, temperature: 0.0 }7.3 监控体系启用 Prometheus 指标trtllm-serve meta-llama/Meta-Llama-3-8B \ --enable_metrics \ --metrics_port 9090 curl http://localhost:9090/metrics核心指标清单完整继承自 serving.mdtrtllm_request_success_total— 成功请求总数trtllm_request_latency_seconds— 请求延迟直方图trtllm_tokens_generated_total— 生成的 token 总数trtllm_active_requests— 当前活跃请求数trtllm_queue_size— 排队中的请求数trtllm_gpu_memory_usage_bytes— GPU 显存占用trtllm_kv_cache_usage_ratio— KV 缓存利用率健康检查curl http://localhost:8000/health/ready # 就绪探针 curl http://localhost:8000/health/live # 存活探针 curl http://localhost:8000/v1/models # 模型信息Kubernetes 探针配置livenessProbe: httpGet: path: /health/live port: 8000 initialDelaySeconds: 60 periodSeconds: 10 readinessProbe: httpGet: path: /health/ready port: 8000 initialDelaySeconds: 30 periodSeconds: 57.4 生产部署清单DockerFROM nvidia/tensorrt_llm:latest # 复制自定义配置 COPY config.yaml /app/config.yaml # 暴露端口 EXPOSE 8000 9090 # 启动服务 CMD [trtllm-serve, meta-llama/Meta-Llama-3-8B, \ --tp_size, 4, \ --dtype, fp8, \ --max_batch_size, 256, \ --enable_metrics, \ --metrics_port, 9090]运行docker run --gpus all -p 8000:8000 -p 9090:9090 \ tensorrt-llm:latestKubernetes 完整部署Deployment ServiceapiVersion: apps/v1 kind: Deployment metadata: name: tensorrt-llm spec: replicas: 2 # 多副本高可用 selector: matchLabels: app: tensorrt-llm template: metadata: labels: app: tensorrt-llm spec: containers: - name: trtllm image: nvidia/tensorrt_llm:latest command: - trtllm-serve - meta-llama/Meta-Llama-3-70B - --tp_size4 - --dtypefp8 - --max_batch_size256 - --enable_metrics ports: - containerPort: 8000 name: http - containerPort: 9090 name: metrics resources: limits: nvidia.com/gpu: 4 livenessProbe: httpGet: path: /health/live port: 8000 readinessProbe: httpGet: path: /health/ready port: 8000 --- apiVersion: v1 kind: Service metadata: name: tensorrt-llm spec: selector: app: tensorrt-llm ports: - name: http port: 80 targetPort: 8000 - name: metrics port: 9090 targetPort: 9090 type: LoadBalancerNGINX 负载均衡least_conn 路由到最空闲实例upstream tensorrt_llm { least_conn; # 路由到最不忙的服务器 server trtllm-1:8000 max_fails3 fail_timeout30s; server trtllm-2:8000 max_fails3 fail_timeout30s; server trtllm-3:8000 max_fails3 fail_timeout30s; } server { listen 80; location / { proxy_pass http://tensorrt_llm; proxy_read_timeout 300s; # 长生成场景需加大超时 proxy_connect_timeout 10s; } }7.5 自动扩缩容HPA基于trtllm_active_requests的 HPA 示例apiVersion: autoscaling/v2 kind: HorizontalPodAutoscaler metadata: name: tensorrt-llm-hpa spec: scaleTargetRef: apiVersion: apps/v1 kind: Deployment name: tensorrt-llm minReplicas: 2 maxReplicas: 10 metrics: - type: Pods pods: metric: name: trtllm_active_requests target: type: AverageValue averageValue: 50 # 平均活跃请求 50 时扩容也可基于队列长度trtllm_queue_size设置averageValue: 10的扩缩容规则。7.6 安全加固API 鉴权# 生成 API key export API_KEY$(openssl rand -hex 32) # 启动带鉴权服务 trtllm-serve meta-llama/Meta-Llama-3-8B \ --api_key $API_KEY # 客户端带 Bearer 请求 curl -X POST http://localhost:8000/v1/chat/completions \ -H Authorization: Bearer $API_KEY \ -H Content-Type: application/json \ -d {model: ..., messages: [...]}Kubernetes 网络策略仅允许网关访问apiVersion: networking.k8s.io/v1 kind: NetworkPolicy metadata: name: tensorrt-llm-policy spec: podSelector: matchLabels: app: tensorrt-llm policyTypes: - Ingress ingress: - from: - podSelector: matchLabels: app: api-gateway # 仅允许来自网关 ports: - protocol: TCP port: 80007.7 成本优化参考仓库记录了不同 GPU 的量级参考部署前建议以云厂商实时价格核算A100 80GB适合 70B 模型 FP8TP4 时约 10,000–15,000 tok/sH100 80GB适合 70B/405B FP8TP4 时约 20,000–30,000 tok/s速度快一倍意味着单位 token 成本更低L4适合 7–8B 模型约 1,000–2,000 tok/s。批大小对成本的影响同一实例批大小 1约 1,000 tok/s批大小 64约 5,000 tok/s单位 token 成本可下降约 5×推荐目标批大小 32–128 以平衡延迟与成本。7.8 生产排障速查高延迟先查queue_size与active_requests指标横向扩容副本、GPU 未饱和时增大批大小、长提示词开启 chunked context、启用 FP8OOM 崩溃降低max_batch_size/max_num_tokens、启用 FP8/INT4、增大tensor_parallel_size超时错误NGINX 侧将proxy_read_timeout与proxy_send_timeout加大到 600s10 分钟应对超长生成。八、支持模型矩阵SKILL.md 记录的支持范围HuggingFace 上 100 模型LLaMA 家族Llama 2、Llama 3、CodeLlamaGPT 家族GPT-2、GPT-J、GPT-NeoXQwenQwen、Qwen2、QwQDeepSeekDeepSeek-V2、DeepSeek-V3MixtralMixtral-8x7B、Mixtral-8x22B视觉模型LLaVA、Phi-3-vision九、仓库延伸阅读本仓库围绕推理服务还提供了互补的技能可结合使用vLLM 服务指南PagedAttention 与连续批处理适合非 NVIDIA 硬件与更简单的 Python 优先场景llama.cpp 指南CPU / Apple Silicon 与 GGUF 量化SGLang 指南RadixAttention 结构化生成量化生态GPTQ、AWQ、HQQ 等校准工具与 TensorRT-LLM 的 INT4 路线配合使用仓库总览README.md 对 Inference Serving 四大技能的定位与选型说明。十、行动清单与最佳实践综合三份文档落地 TensorRT-LLM 的十步最佳实践在 NVIDIA GPU 上优先选择 TensorRT-LLMA100/H100/GB200H100 上默认启用FP8获得 2× 加速与 50% 内存缩减从最小的可容纳模型的TP起步再逐步扩展所有 TP 部署使用NVLink多节点部署使用InfiniBand调大max_batch_size到 OOM 前再回退 20%充分压榨 in-flight batching长提示词场景开启 chunked context延迟敏感场景尝试推测解码生产环境必开 Prometheus 指标并配合 Grafana 可视化配置 readiness/liveness 探针防止流量路由到不健康 Pod用 NGINX/Service 做负载均衡按trtllm_active_requests配置 HPA 自动扩缩容部署前运行tensorrt_llm[benchmark]基准测试持续跟踪吞吐、P50/P99 延迟、显存与 GPU 利用率。通过以上路径你可以在 AI-Research-SKILLs 仓库的指引下把 TensorRT-LLM 从「快速体验」推进到「生产级多节点服务」让 AI 研究 Agent 的推理环节真正具备低延迟、高吞吐的工程化能力。赞分享AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载相关推荐如何用pdf-to-podcast轻松将PDF转换为播客完整入门指南如何用pdf to podcast轻松将PDF转换为播客完整入门指南 pdf to podcast是一款创新工具能够帮助用户将任何PDF文档转换为生动的播客TensorRT-LLM赋能Qwen模型高性能推理部署实践与优化指南TensorRT LLM赋能Qwen模型高性能推理部署实践与优化指南 大型语言模型LLMs正以前所未有的能力推动人工智能技术边界但其庞大的参数规模导致部人工智能深度学习大模型多模态2025终极指南如何从零开始部署ruoyi-vue-pro企业级后台管理系统2025终极指南如何从零开始部署ruoyi vue pro企业级后台管理系统 还在为寻找一套功能完整、易于部署的企业级后台管理系统而烦恼吗今天我要为你介绍一后端前端低代码认证鉴权企业应用上一篇Vex的10个强大功能为什么它是终端用户的Excel替代品下一篇如何在仅128字节RAM的8051单片机上运行cJSON6个实用技巧揭秘创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
