Traduzido do inglês

TensorRT-LLM é uma biblioteca de código aberto da Nvidia para otimizar e servir grandes modelos de linguagem em GPUs da Nvidia. Ela fornece uma API em Python para definir LLMs e construir engines TensorRT com recursos avançados como in-flight batching e quantização.

TensorRT-LLM é uma biblioteca de software de código aberto desenvolvida pela Nvidia para otimizar e servir modelos de linguagem de grande porte em unidades de processamento gráfico (GPUs) da Nvidia. Ela faz parte da família mais ampla de produtos TensorRT, que também inclui o SDK principal do TensorRT e o TensorRT-RTX. O TensorRT-LLM fornece uma API em Python que permite aos desenvolvedores definir modelos de linguagem de grande porte e compilá-los em mecanismos TensorRT altamente otimizados, projetados especificamente para inferência de baixa latência e alta taxa de transferência em hardware da Nvidia.

O TensorRT-LLM é construído sobre o SDK principal do TensorRT, que realiza otimizações em nível de grafo e de kernel, como fusão de camadas e seleção eficiente de kernels. Ao estender essas capacidades para modelos de linguagem de grande porte, o TensorRT-LLM atende às demandas computacionais únicas das arquiteturas baseadas em transformadores, que são a base de muitas aplicações modernas de IA generativa.

Principais recursos

O TensorRT-LLM oferece suporte a uma variedade de recursos avançados para maximizar o desempenho da inferência. Isso inclui execução com múltiplas GPUs e múltiplos nós, permitindo que os modelos sejam escalados em várias GPUs em um único servidor ou em um cluster. O agrupamento em lote em voo (in-flight batching) possibilita o agrupamento dinâmico de solicitações de inferência, melhorando a utilização da GPU e a taxa de transferência. O cache de KV paginado (paged KV caching) reduz a sobrecarga de memória ao gerenciar eficientemente o cache de chave-valor usado nos mecanismos de atenção dos transformadores. Além disso, o TensorRT-LLM suporta vários métodos de quantização, incluindo FP8, INT8 e INT4, que reduzem o tamanho do modelo e aceleram a inferência em hardware compatível.

Integração com o ecossistema de aprendizado profundo

O TensorRT-LLM integra-se com frameworks de aprendizado de máquina e ferramentas populares. Ele pode importar modelos de frameworks como PyTorch e TensorFlow por meio de seu parser ONNX, permitindo que os desenvolvedores aproveitem artefatos de modelos existentes. A biblioteca também fornece um mecanismo de plugins para camadas personalizadas, habilitando o suporte a operações que não estão incluídas nativamente. Essa integração faz parte da estratégia mais ampla da Nvidia de oferecer uma pilha de software abrangente para a implantação de inteligência artificial, complementando outras ferramentas da Nvidia, como CUDA e cuDNN.

Otimização de desempenho

Um dos principais objetivos do TensorRT-LLM é oferecer desempenho de inferência de última geração para modelos de linguagem de grande porte. Ao compilar modelos em mecanismos otimizados, o TensorRT-LLM reduz a latência e aumenta a taxa de transferência em comparação com a execução dos modelos em seus frameworks originais. A biblioteca inclui recursos como ajuste automático de kernels e otimizações de grafo, que são especificamente adaptados aos padrões computacionais dos modelos de transformadores. Como resultado, o TensorRT-LLM é amplamente utilizado em ambientes de produção onde respostas de baixa latência são críticas, como em assistentes de chat em tempo real e serviços de geração de código.

Casos de uso e adoção

O TensorRT-LLM é usado por desenvolvedores e organizações para implantar modelos de linguagem de grande porte em diversas aplicações, incluindo compreensão de linguagem natural, geração de texto e conclusão de código. Ele é particularmente popular em ambientes de nuvem, onde pode ser usado com GPUs da Nvidia para servir modelos em escala. A natureza de código aberto da biblioteca promoveu uma comunidade de colaboradores que melhoram continuamente seu desempenho e adicionam suporte a novas arquiteturas de modelos. O TensorRT-LLM também é um componente-chave nas ofertas empresariais da Nvidia, como o Nvidia AI Enterprise, que fornece uma plataforma suportada para a implantação de IA.

Conclusão

O TensorRT-LLM representa um avanço significativo na otimização da inferência de modelos de linguagem de grande porte em hardware da Nvidia. Ao fornecer uma API em Python de alto nível e aproveitar o poder do TensorRT, ele permite que os desenvolvedores alcancem desempenho excepcional com esforço mínimo. À medida que a demanda por inferência eficiente de IA continua a crescer, é provável que o TensorRT-LLM permaneça uma ferramenta essencial na pilha de infraestrutura de IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:nvidia·large-language-models·inference-optimization·open-source
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico