Inferencia, en inteligencia artificial, es el proceso de ejecutar un modelo entrenado sobre una nueva entrada para producir una salida, a diferencia del entrenamiento, la fase anterior en la que los parámetros del modelo se aprenden a partir de datos. Un modelo de lenguaje grande respondiendo a la pregunta de un usuario, un clasificador de imágenes etiquetando una fotografía y un modelo de difusión generando una imagen a partir de un mensaje de texto están todos realizando inferencia. Una vez que el entrenamiento finaliza y los pesos del modelo se fijan, cada uso posterior de ese modelo es una llamada de inferencia.
Coste y hardware
La inferencia tiene demandas computacionales diferentes al entrenamiento. Entrenar un modelo grande requiere procesar conjuntos de datos enormes en múltiples pasadas y normalmente se ejecuta en grandes clústeres de GPUs o TPUs durante semanas o meses. La inferencia, en cambio, se ejecuta de forma continua, a menudo sirviendo millones de solicitudes individuales, y su estructura de costes depende más de la latencia, el tiempo para producir una sola respuesta, y del rendimiento, el número de solicitudes que un sistema puede atender por unidad de hardware, que del cómputo total consumido por un solo trabajo. Debido a que los modelos de lenguaje generan texto un token a la vez, con cada nuevo token dependiendo de todos los anteriores, la inferencia para modelos autorregresivos es comparativamente lenta y está limitada por la memoria más que por el cómputo, lo que ha impulsado una ola de ingeniería de inferencia especializada distinta de la investigación centrada en el entrenamiento. NVIDIA y otros fabricantes de chips han lanzado hardware específicamente optimizado para cargas de trabajo de inferencia, y los proveedores de nube fijan precios diferentes para la capacidad de inferencia y de entrenamiento.
Técnicas de optimización
Debido a que el coste de la inferencia escala directamente con el uso, es un objetivo principal para la optimización. La cuantificación reduce la precisión numérica de los pesos del modelo, recortando el uso de memoria y a menudo acelerando el cálculo con una pérdida modesta de precisión. La destilación de conocimiento entrena un modelo más pequeño para imitar uno más grande, produciendo un modelo que es más barato de ejecutar en tiempo de inferencia. El decodificado especulativo utiliza un pequeño modelo de borrador rápido para proponer varios tokens a la vez, que un modelo más grande verifica luego en paralelo, reduciendo el número de pasos secuenciales lentos necesarios para generar salidas largas. Agrupar las solicitudes de múltiples usuarios, almacenar en caché resultados intermedios previamente calculados como la caché de clave-valor de atención, y enrutar consultas más simples a modelos más pequeños son técnicas adicionales comunes para reducir el coste de servir un modelo a escala.
Cómputo en tiempo de prueba
La inferencia ha sido tradicionalmente tratada como un paso fijo y ligero en comparación con el entrenamiento, pero el auge de los modelos de razonamiento que generan razonamiento interno extendido antes de responder introdujo una nueva dimensión: gastar más cómputo en tiempo de inferencia, un enfoque conocido como cómputo en tiempo de prueba, puede mejorar sustancialmente la calidad de la salida en problemas difíciles. Esto difuminó la suposición anterior de que solo el cómputo en tiempo de entrenamiento importaba para la capacidad, ya que un modelo ahora puede intercambiar el coste de inferencia por precisión en un problema dado al "pensar más tiempo", una compensación que no existía de la misma manera para generaciones anteriores de modelos que producían una cantidad fija de salida independientemente de la dificultad de la tarea.
Economía
Debido a que los productos de IA ampliamente utilizados sirven solicitudes de inferencia continuamente, el coste de inferencia, no el de entrenamiento, domina la economía a largo plazo de ejecutar un modelo desplegado, y la discusión industrial sobre el gasto en infraestructura de IA se centra cada vez más en la capacidad de inferencia a medida que el uso escala, junto con la inversión continua en preentrenamiento de modelos cada vez más grandes.