Cómo maximizar la eficiencia de la IA con modelos de lenguaje pequeños (SLMs) y CPUs

Entérese cómo un enfoque del tamaño adecuado con modelos de lenguaje pequeños puede ayudarle a mejorar la rentabilidad, la precisión y la seguridad.

Puntos clave

  • Los modelos de lenguaje pequeños son modelos de IA de lenguaje ligero y ágil derivados de modelos de lenguaje de gran tamaño (LLMs).

  • En todo el proceso, los SLMs requieren menos datos de entrenamiento y potencia computacional que los LLMs.

  • Cuando se combinan con una CPU optimizada para IA, los SLMs permiten aprovechar capacidades de IA personalizadas que pueden ejecutarse de manera receptiva en una arquitectura ligera.

  • Los procesadores Intel® Xeon® ofrecen una plataforma ideal para las cargas de trabajo de SLM y aplicaciones mejoradas con IA.

author-image

Por

Considere enfoques alternativos para el desarrollo y la implementación de IA de lenguaje

Las empresas, los ISVs y otras organizaciones de tecnología están buscando maneras de hacer que la IA sea innovadora y viable. Normalmente, el desarrollo y la implementación de modelos de IA de lenguaje depende de modelos de lenguaje de gran tamaño (LLMs) respaldados por servidores y estaciones de trabajo con GPUs independientes u otro hardware especializado. Sin embargo, el esfuerzo y la infraestructura necesarios para utilizar este tipo de soluciones a menudo resultan prohibitivos para muchas organizaciones.

Es por eso que los innovadores pragmáticos están optando por soluciones basadas en SLM. Los SLMs son modelos livianos y especializados que pueden facilitar aplicaciones de dominios específicos basadas en lenguaje, como los chatbots, de manera más eficiente. Para lograr una rentabilidad aún mayor, estos innovadores de los SLMs están analizando maneras de ejecutar cargas de trabajo de SLM en arquitecturas solo con CPU, ya sea que se implementen en la nube, en un centro de datos local o en el edge.

Para ayudarle a comprender mejor cómo puede utilizar IA de lenguaje para dominios específicos de manera más eficiente, veamos qué es lo que hace que la combinación de SLMs y CPUs preparadas para la IA, como los procesadores Intel® Xeon®, sea tan potente.

Simplifique las soluciones de IA de lenguaje con SLMs

Para las empresas que priorizan la eficiencia, la privacidad y la rentabilidad, los SLMs ofrecen una excelente vía para acceder a las capacidades de IA. A diferencia de los LLMs, demasiado amplios y de uso general, los SLMs son modelos compactos de IA diseñados para realizar tareas específicas de manera eficiente. Como resultado, requieren menos potencia computacional y datos en cada etapa de los procesos de IA. Algunos ejemplos populares de SLMs son Mistral 7B y la colección Llama 3.2.

Beneficios de eficiencia y costos

Normalmente, los SLMs se derivan de LLMs a través de técnicas como la destilación y la poda. Debido a que los SLMs implican menos datos, se pueden entrenar y volver a entrenar con frecuencia sin incurrir en costos significativos de electricidad o de recursos en la nube. Esta flexibilidad puede ayudar a ajustar y perfeccionar el desempeño de su modelo sin consumir demasiado presupuesto ni tiempo.

Beneficios de seguridad y privacidad

Además, los SLMs ofrecen beneficios en materia de privacidad y seguridad. Debido a que requieren menos datos de entrenamiento y su uso está menos extendido, los SLMs son menos propensos a procesar y conservar información confidencial. Por otro lado, dado que utilizan un conjunto de datos más pequeño y una arquitectura más simple, explicar los resultados e identificar sesgos o alucinaciones resulta más sencillo. Y como requieren menos recursos, los SLMs también presentan un área de superficie de ataque más pequeña ante amenazas de ciberseguridad.

Beneficios de la IA para dominios específicos

Dado que los SLMs se crean con conjuntos de datos más pequeños y especializados, son ideales para utilizarse en aplicaciones de dominios específicos. El entrenamiento con un conjunto de datos diseñado para una industria, un campo o una empresa específicos ayuda a los SLMs a obtener una comprensión profunda y precisa que puede reducir el riesgo de resultados erróneos. El enfoque más específico también facilita la optimización de métricas como la tasa de finalización de tareas y la precisión. Además, los menores requisitos de datos y entrenamiento de los SLMs se pueden traducir en una aceleración de los tiempos de respuesta y el retorno de la inversión.

Maximice la eficiencia con SLMs en CPUs

Los SLMs y las CPUs preparadas para la IA se pueden utilizar en conjunto para ofrecer una solución ligera y rentable para la implementación de IA de lenguaje en usos reales sin sacrificar el desempeño. El uso de CPUs en lugar de GPUs u otro hardware especializado para modelos de lenguaje pequeños puede minimizar los costos, la complejidad y el consumo de recursos.

Por ejemplo, los servidores basados en procesadores Intel® Xeon® más recientes, de 4ᵃ generación y posteriores, les permiten a los usuarios ejecutar SLMs en una arquitectura solo con CPU de manera asequible, privada y con baja latencia. Debido a su flexibilidad y desempeño, el uso de estos procesadores para modelos de lenguaje pequeños ofrece una manera particularmente atractiva de utilizar aplicaciones de SLM en implementaciones locales, lo que puede ser preferible cuando se tienen necesidades de seguridad de datos muy estrictas.

Aceleradores integrados en los procesadores Intel® Xeon®

Los procesadores Intel® Xeon® 4, 5 y 6 también ofrecen el acelerador Intel® Advanced Matrix Extensions (Intel® AMX) integrado, que se combina con un mayor ancho de banda de memoria para mejorar la eficiencia computacional para los SLMs. Además, como el tamaño del modelo es más pequeño, se pueden ejecutar aplicaciones completas en un solo nodo basado en los procesadores Intel® Xeon®, lo que reduce significativamente los costos y ofrece una latencia y una capacidad de procesamiento excelentes.

Intel® AMX mejora el desempeño del entrenamiento y la inferencia del aprendizaje profundo (DL), lo que lo hace ideal para cargas de trabajo como el procesamiento de lenguaje natural. Puede programar funcionalidades de IA para aprovechar el conjunto de instrucciones de Intel® AMX o funcionalidades no relacionadas con la IA para usar la arquitectura de conjuntos de instrucciones del procesador.

También es importante destacar que los procesadores Intel® Xeon® más recientes ofrecen una variedad de motores de optimización y aceleración integrados además de Intel® AMX, lo que permite utilizarlos en varios casos de uso, como en el ámbito de seguridad y redes.

 

Llama 3.2 3B en los procesadores Intel® Xeon®

Los resultados de los análisis de referencia demuestran que la ejecución de Llama 3.2 3B con una entrada de 1024 tokens y una salida de 128 tokens en los procesadores Intel® Xeon® de 5ᵃ generación e Intel® Xeon® 6 con P-cores puede lograr un desempeño extraordinario manteniendo una latencia del siguiente token de menos de 50 ms (P99).1

 

Microsoft Phi-3 en los procesadores Intel® Xeon®

La familia de SLMs Phi-3 ofrece opciones eficaces y rentables para crear aplicaciones de IA generativa (GenAI). El análisis de referencia de las variantes Phi-3-medium de 4K y 128K demuestra que los procesadores Intel® Xeon® son una opción eficiente para la implementación de la inferencia de LLM.2

Evalúe sus oportunidades de utilizar SLMs con CPUs

Los SLMs que se ejecutan en CPUs ofrecen una manera viable, rentable, precisa y segura para hacer que los modelos de IA de lenguaje y de dominios específicos sean más prácticos de implementar para su organización.

Además, su ruta para ejecutar SLMs en una arquitectura de CPU, con procesadores Intel® Xeon®, puede ser más directa de lo que espera.

A continuación, le ofrecemos cuatro pasos que puede seguir hoy mismo para comenzar a evaluar sus opciones de SLMs en CPU:

  1. Evalúe sus inversiones actuales con su equipo de infraestructura. Muchas organizaciones tienen servidores basados en procesadores Intel® Xeon, y actualizar su infraestructura existente con una migración a los procesadores Intel® Xeon® 6 con Intel® AMX puede ofrecer enormes beneficios en cuanto a TCO para los SLMs.
  2. Consulte con su proveedor de la nube. Los principales proveedores de servicios en la nube ofrecen instancias basadas en los procesadores Intel® Xeon® con el acelerador Intel® AMX listas para que pueda aprovecharlas.
  3. Analice las opciones con sus socios de tecnología. Los socios de Intel® pueden ayudarle a aprovechar al máximo nuestras tecnologías, incluidos los procesadores Intel® Xeon®, para modelos de lenguaje pequeños desde el edge hasta la nube.
  4. Descubra lo fácil que es migrar aplicaciones de IA existentes a arquitecturas de CPU. Intel ofrece una variedad de herramientas de desarrollo, incluido el kit de herramientas OpenVINO™, que permiten escribir código una vez e implementarlo en cualquier sitio.