Aspectos destacados
- Soporte multilingüe completo: Llama 3.1 sobresale en el manejo de ocho idiomas, lo que lo hace ideal para aplicaciones multilingües globales.
- Escala masiva y eficiencia computacional: Con 405 mil millones de parámetros, Llama 3.1 está optimizado computacionalmente para un alto rendimiento sin recursos excesivos.
- Rendimiento de vanguardia en benchmarks: Compite con modelos líderes como GPT-4, destacándose en tareas de codificación, matemáticas y contexto largo.
- Arquitectura de modelo mejorada y alineación: Técnicas avanzadas como DPO alinean las salidas con las preferencias humanas, aumentando la fiabilidad.
- Accesibilidad de código abierto: Meta proporciona acceso abierto a Llama 3.1, fomentando la colaboración y la innovación en IA.
- Habilidades inigualables de codificación y razonamiento: El modelo ofrece un rendimiento superior en codificación y tareas complejas de resolución de problemas.
Introducción
En el cambiante mundo de la Inteligencia Artificial (IA), los modelos de lenguaje grandes (LLMs) representan algunas de las mejores tecnologías nuevas. Estos modelos, entrenados con enormes cantidades de datos, son muy buenos para comprender y crear texto que suene como escrito por una persona. Esta publicación de blog explorará el artículo de Llama 3.1 de Meta. Te dará una visión clara de su diseño, capacidades e importancia como modelo fundamental en el campo del PLN.
Una visión general de Llama 3.1

El último modelo de lenguaje insignia de Meta, Llama 3.1, con 405 mil millones de parámetros, muestra la dedicación de Meta al avance de la IA. Destaca en diversas tareas e idiomas, allanando el camino para nuevos modelos basados en la investigación y la innovación de Meta.
Información del modelo
El conjunto Meta Llama 3.1 incluye modelos de lenguaje grandes (LLMs) multilingües en tamaños de 8B, 70B y 405B, preentrenados y ajustados para tareas de texto generativo. Estos modelos Llama 3.1 solo de texto sobresalen en aplicaciones de diálogo multilingüe y superan muchos benchmarks de la industria.
El modelo admite oficialmente ocho idiomas: inglés, alemán, francés, italiano, portugués, hindi, español y tailandés. El entrenamiento subyacente sugiere capacidades más allá de estos idiomas.
Arquitectura del modelo
Llama 3.1 es un modelo de lenguaje autorregresivo construido sobre una arquitectura transformer optimizada. Sus versiones mejoradas se refinan mediante ajuste fino supervisado (SFT) y aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), adaptadas para cumplir con los estándares humanos de utilidad y seguridad.

En qué se diferencia Llama 3.1

Llama 3.1 se distingue de versiones anteriores y competidores en varios aspectos importantes:
- Escala: Con 405 mil millones de parámetros, es sustancialmente más grande que sus predecesores. El artículo de Llama 3.1 revela: “Entrenamos un modelo a una escala mucho mayor que los modelos Llama anteriores: nuestro modelo insignia de lenguaje utilizó 3.8 × 10²⁵ FLOPs, casi 50 veces más que la versión más grande de Llama 2.”
- Tamaño óptimo computacionalmente: La elección de 405 mil millones de parámetros se basa estratégicamente en las leyes de escalado, como se indica en el artículo de Llama 3.1: “Este tamaño es óptimo computacionalmente según las leyes de escalado dado nuestros datos y presupuesto de entrenamiento.”
- Capacidades multilingües: Llama 3.1 compite con los mejores modelos de IA como GPT-4 en varios benchmarks, afirmando el artículo de Llama 3.1: “Nuestra evaluación experimental sugiere que nuestro modelo insignia iguala a modelos de lenguaje líderes como GPT-4 en una variedad de tareas, acercándose al rendimiento de vanguardia.”
Acceso y comprensión del artículo de Llama 3.1
El artículo de Llama 3.1 es un hito en la comunidad de IA de código abierto, proporcionando información sobre el robusto modelo de lenguaje grande (LLM). Explica la arquitectura del modelo, los procesos de entrenamiento y el rendimiento, fomentando el aprendizaje y la innovación en la comprensión de los LLM y su funcionalidad, aplicaciones y limitaciones.
- El valor del artículo de Llama 3.1: El artículo de Llama 3.1 es esencial para los profesionales de la IA, ya que ofrece información detallada sobre el diseño del modelo, las evaluaciones de rendimiento centradas en el ser humano y los enfoques de seguridad y alineación, fomentando la transparencia y la confianza en los sistemas de IA.
- Descarga del PDF del artículo de Llama 3.1: El compromiso de Meta con la ciencia abierta se ejemplifica con la disponibilidad gratuita del artículo de Llama 3.1 en formato PDF, mejorando la accesibilidad y fomentando una mayor participación en la investigación de IA.
Uso previsto
Llama 3.1 revoluciona la investigación en IA al ofrecer un modelo de lenguaje potente para investigadores globales. Sus avanzadas habilidades lingüísticas benefician aplicaciones de la vida real como mejorar chatbots y sistemas de IA para una mejor comunicación en servicio al cliente, educación y atención médica.
Casos de uso previstos
Llama 3.1 está diseñado tanto para aplicaciones comerciales como de investigación en múltiples idiomas. Los modelos solo de texto ajustados con instrucciones están específicamente orientados a funciones de chat similares a asistentes, mientras que los modelos preentrenados son lo suficientemente versátiles como para adaptarse a una variedad de tareas de generación de lenguaje natural. Además, la colección de modelos Llama 3.1 facilita la mejora de otros modelos mediante el uso de sus salidas, incluida la generación de datos sintéticos y la destilación. La Licencia Comunitaria Llama 3.1 respalda estos diversos casos de uso.
Cómo usar
Este repositorio incluye dos versiones de Meta-Llama-3.1–70B, una compatible con transformers y la otra con el código base original de Llama.
Uso con transformers
A partir de transformers >= 4.43.0 en adelante, puedes realizar inferencias conversacionales utilizando la abstracción de pipeline de Transformers o utilizando las clases Auto con la función generate().
Asegúrate de actualizar tu instalación de transformers ejecutando pip install --upgrade transformers.
import transformers
import torch
model_id = “meta-llama/Meta-Llama-3.1-70B”
pipeline = transformers.pipeline(
pipeline(“Hey how are you doing today?”)
Conjunto de datos de entrenamiento de Llama 3.1
El conjunto de datos de preentrenamiento de Llama 3.1 fue una mezcla cuidadosamente seleccionada y bien equilibrada de varios dominios generales, meticulosamente procesada para garantizar entradas de entrenamiento diversas y de alta calidad.
Datos de preentrenamiento
La construcción del conjunto de datos implica cuatro etapas principales:
- Filtrado de calidad: Se eliminan leyendas no inglesas y de baja calidad utilizando medidas heurísticas como puntuaciones CLIP.
- Deduplicación perceptual: Un modelo interno de detección de copias SSCD deduplica imágenes a gran escala, conservando un par imagen-texto por grupo duplicado.
- Remuestreo: Para garantizar la diversidad, se crean n-gramas a partir de fuentes de texto de alta calidad y se remuestrean los datos según sus frecuencias.
- Reconocimiento óptico de caracteres: El texto dentro de las imágenes se extrae mediante un pipeline OCR propietario y se combina con leyendas.
Para mejorar la comprensión de documentos, el conjunto de datos también incluye:
- Transcripción de documentos: Las páginas de documentos se renderizan como imágenes con texto emparejado.
- Seguridad de contenido: Se utilizan técnicas como hash perceptual para eliminar contenido inseguro como CSAM.
- El conjunto de datos se refina hasta aproximadamente 350 millones de pares imagen-leyenda y se enriquece con 150 millones de ejemplos adicionales de diversas fuentes, incluyendo anclaje visual, análisis de capturas de pantalla, pares de preguntas y respuestas, leyendas sintéticas e imágenes estructuradas generadas sintéticamente.
Datos de post-entrenamiento
Datos SFT:
- Para imágenes: Los conjuntos de datos académicos se transforman en pares de preguntas y respuestas mediante plantillas y reescrituras con LLM. Anotadores humanos crean diálogos diversos a partir de datos multimodales para mejorar el contenido generado por el modelo.
- Para datos sintéticos: Se utilizan representaciones textuales de imágenes con LLMs de entrada de texto para crear pares de preguntas y respuestas para las imágenes correspondientes. Este proceso implica convertir textos de preguntas y respuestas y datos tabulares en imágenes sintéticas utilizando leyendas y extracciones OCR para generar datos conversacionales.
- Para videos: Los conjuntos de datos académicos con anotaciones se convierten en instrucciones textuales y respuestas objetivo para preguntas. Los humanos anotan videos con preguntas y respuestas complejas que requieren más de un solo fotograma para su contexto.
Datos de preferencia:
El conjunto de datos incluye salidas del modelo calificadas como “elegido” o “rechazado” en una escala de 7 puntos, con anotaciones humanas para preferencias y correcciones. Se crean pares de preferencia sintéticos utilizando LLMs solo de texto para introducir errores en el conjunto de datos de ajuste fino, generando muestras negativas mediante muestreo por rechazo de respuestas de alta calidad no seleccionadas.
Aplicación de DPO a Llama 3.1
Meta implementó la Optimización Directa de Preferencias (DPO) como una parte crucial del proceso de post-entrenamiento de Llama 3.1 para alinear mejor el modelo con las preferencias humanas. Aquí hay un desglose de cómo se llevó a cabo este proceso:
Configuración inicial:
- El proceso comienza entrenando con datos de preferencia anotados por humanos, basándose en los modelos más exitosos de rondas de alineación anteriores.
- El objetivo principal es garantizar que los datos de entrenamiento se asemejen lo más posible a la distribución del modelo de política que se optimiza en cada ciclo, lo que ayuda a mejorar progresivamente el rendimiento del modelo.
- Recopilación de datos de preferencia:

- Los datos de preferencia se recopilan de anotadores humanos que evalúan múltiples respuestas generadas por el modelo para cada indicación. Estas evaluaciones se basan en la calidad y preferencia de las respuestas, con clasificaciones claras como editado > elegido > rechazado.
- Estos datos abarcan respuestas ordenadas en varios niveles de preferencia (significativamente mejor, mejor, ligeramente mejor o marginalmente mejor) y ocasionalmente incluyen respuestas editadas para refinar aún más la respuesta elegida.
Experimento de Llama 3.1
Los experimentos de visión de Llama 3.1 evalúan su rendimiento en el reconocimiento de imágenes y videos. Los experimentos de habla muestran sus capacidades de reconocimiento de voz. Los resultados resaltan la resiliencia del modelo y sus posibles aplicaciones en IA.
Experimentos de visión de Llama 3.1
Resultados de reconocimiento de imágenes

- El modelo Llama 3-V 405B supera a GPT-4V en todos los benchmarks, aunque va ligeramente por detrás de Gemini 1.5 Pro y Claude 3.5 Sonnet.
- Muestra una fortaleza particular en tareas de comprensión de documentos.
Resultados de reconocimiento de video

- Llama 3 sobresale en el reconocimiento de video, particularmente con los modelos de parámetros 8B y 70B evaluados.
- Se desempeña excepcionalmente bien en PerceptionTest, lo que indica una capacidad robusta para el razonamiento temporal complejo.
- En tareas de comprensión de actividades de formato largo, como ActivityNet-QA, Llama 3 ofrece resultados sólidos a pesar de procesar solo hasta 64 fotogramas. Esto significa que para un video de tres minutos, el modelo procesa solo un fotograma cada tres segundos.
Experimentos de habla de Llama 3.1

Un sistema de texto a voz (TTS) en streaming en tiempo real ahora forma parte de Llama 3, creando formas de onda de voz mientras decodifica. Este sistema TTS utiliza incrustaciones de Llama 3 para mejorar la latencia, precisión y naturalidad durante la inferencia.
¿Qué es el recocido y cómo funciona?
Entrenar modelos de lenguaje grandes como Llama 3.1 implica ‘recocido’, que ajusta el modelo para un mejor rendimiento en tareas. El término se toma prestado de la metalurgia, donde el recocido fortalece los materiales calentándolos y enfriándolos lentamente.
El proceso de recocido para Llama 3.1 implica varios componentes clave:
- Reducción gradual de la tasa de aprendizaje: La tasa de aprendizaje se reduce sistemáticamente a cero, estabilizando los parámetros y mejorando la generalización al minimizar el sobreajuste.
- Remuestreo de datos de alta calidad: La mezcla de datos de entrenamiento se ajusta para priorizar fuentes de alta calidad, mejorando el rendimiento y la precisión del modelo.
- Promedio de Polyak: Esta técnica promedia parámetros de varios puntos de control durante el recocido para crear un modelo preentrenado estable.
En general, el proceso de recocido asegura una convergencia suave, mejora la estabilidad mediante actualizaciones de parámetros más pequeñas y da como resultado un modelo robusto y preciso, bien equipado para la generalización a nuevos datos.
Mejora de las capacidades de codificación, multilingües y más de Llama 3.1
Se puso énfasis en mejorar las capacidades de Llama 3.1 mediante entrenamiento adicional en codificación, habilidades multilingües, razonamiento matemático, manejo de contexto largo, uso de herramientas, precisión y direccionabilidad. Las evaluaciones humanas y las anotaciones aseguraron un rendimiento de la más alta calidad en estas características optimizadas.
Habilidades de codificación de Llama 3.1

Llama 3.1 muestra un rendimiento robusto en una variedad de benchmarks de codificación. Las evaluaciones utilizan la métrica pass@N, que mide la tasa de éxito de un conjunto de pruebas unitarias en N generaciones. Los hallazgos clave incluyen:
Generación de código Python:
- HumanEval: Llama 3 8B puntúa 72.6±6.8, 70B alcanza 80.5±6.1, y 405B logra 89.0±4.8.
- MBPP: Llama 3 8B puntúa 60.8±4.3, 70B logra 75.4±3.8, y 405B alcanza 78.8±3.6.
- HumanEval+: Los resultados son 67.1±7.2 para Llama 3 8B, 74.4±6.7 para 70B, y 82.3±5.8 para 405B.
Generación de código en múltiples lenguajes de programación:
- Las evaluaciones se realizan utilizando MultiPL-E, que cuenta con traducciones de problemas de HumanEval y MBPP a varios lenguajes de programación como C++, Java, PHP, TypeScript y C#.
- Para HumanEval en C++: Llama 3 8B puntúa 52.8 ±7.7, y Llama 3 405B logra 82.0 ±5.9.
- Para MBPP en C++: Llama 3 8B puntúa 53.7 ±4.9, y Llama 3 405B logra 67.5 ±4.6.
Capacidades matemáticas y de razonamiento de Llama 3.1

Llama 3.1 ha mostrado un rendimiento notable en varios benchmarks de matemáticas y razonamiento, subrayando su competencia en estas áreas. A continuación se presentan los resultados clave de las evaluaciones:
GSM8K (8 disparos, Cadena de pensamiento — CoT):
- Llama 3 8B: 57.2±2.7
- Llama 3 70B: 83.0±7.4
- Llama 3 405B: 90.0±5.9
MATH (0 disparos, CoT):
- Llama 3 8B: 20.3±1.1
- Llama 3 70B: 41.4±1.4
- Llama 3 405B: 53.8±1.4
ARC Challenge (0 disparos):
- Llama 3 8B: 79.7±2.3
- Llama 3 70B: 92.9±1.5
- Llama 3 405B: 96.1±1.1
Meta enfrentó varios desafíos para mejorar las capacidades matemáticas y de razonamiento de Llama 3.1, que incluyen:
- Falta de indicaciones
- Falta de cadena de pensamiento de verdad fundamental
- Pasos intermedios incorrectos
- Enseñar a los modelos a usar herramientas externas
- Discrepancia entre entrenamiento e inferencia
¿Cómo se desempeña Llama 3.1 en escenarios de contexto largo?

Llama 3.1 sobresale en benchmarks de contexto largo, mostrando su capacidad para manejar y recuperar información eficientemente de documentos extensos. Aquí están los resultados clave de la evaluación:
- Needle-in-a-Haystack: Logra una tasa de éxito del 100% en la recuperación de información oculta en documentos largos y resultados casi perfectos en la variante Multi-needle.
- ZeroSCROLLS: Los modelos 405B y 70B igualan o superan a los competidores en comprensión del lenguaje natural sobre textos extensos.
- InfiniteBench: El modelo 405B supera a todos los competidores en tareas que requieren comprensión de contexto largo, destacando especialmente en preguntas y respuestas sobre novelas (En.QA).
Después de revisar el artículo de LLaMA 3.1, sus contribuciones académicas brillan en escenarios del mundo real. La API LLM simplifica la investigación compleja para los desarrolladores al tender un puente entre la teoría académica y la implementación práctica de manera eficiente. Exploremos cómo la API LLM logra esto.
Utilización de variantes de Llama 3.1 en Novita.AI
Novita AI es una plataforma robusta para gestionar modelos Llama 3.1, que ofrece una interfaz intuitiva y potentes API que simplifican la integración en aplicaciones del mundo real. Automatiza la gestión del sistema, escala los recursos de manera eficiente y garantiza un alto rendimiento, priorizando la seguridad y la privacidad de los datos. Al permitir un acceso fácil a LLMs avanzados, Novita AI capacita a desarrolladores y empresas para acelerar proyectos de IA e impulsar la innovación en diversas industrias.
¿Cómo implementar la API LLM en Novita.AI?
Sigue estos pasos estructurados cuidadosamente para desarrollar aplicaciones potentes de procesamiento de lenguaje utilizando la API Llama 3.1 en Novita AI. Esta guía detallada asegura un proceso fluido y eficiente, satisfaciendo las necesidades de los desarrolladores modernos que buscan una plataforma de IA avanzada.
Paso 1: Regístrate e inicia sesión en Novita AI

Paso 2: Navega a la pestaña Dashboard en Novita AI para obtener tu clave API. También puedes optar por crear una nueva clave.

Paso 3: Después de llegar a la página de claves, haz clic en “Copiar” para recuperar tu clave fácilmente.

Paso 4: Ve a la referencia de la API LLM para descubrir las “APIs” y “Modelos” que ofrece Novita AI.

Paso 5: Elige el modelo que mejor se adapte a tus requisitos. Configura tu entorno de desarrollo y ajusta configuraciones como contenido, rol, nombre e indicación detallada según corresponda.

Paso 6: Realiza varias pruebas para confirmar el rendimiento consistente de la API.
¿Cómo experimentar con el LLM Playground en Novita AI?
Antes de implementar oficialmente la API LLM en Novita AI, puedes explorar y experimentar con ella en el LLM Playground. Ofrecemos a los desarrolladores una cuota de uso gratuita. A continuación, te guiaré paso a paso a través del proceso para comenzar.
Paso 1: Accede al Playground: Ve a la pestaña Products en el menú, selecciona Model API y comienza a explorar eligiendo la API LLM.

Paso 2: Selecciona entre varios modelos: Elige el modelo llama que mejor se adapte a tus necesidades de evaluación.

Paso 3: Ingresa tu indicación y genera la salida: Introduce la indicación que deseas usar en el campo designado. Esta área es donde escribes el texto o la pregunta para que el modelo lo procese.
Conclusión
El artículo de Llama 3.1 habla de un nuevo modelo que tiene habilidades increíbles en muchas áreas. Cubre todo, desde cómo está construido el modelo hasta los resultados de las pruebas y para qué se puede usar. Esta guía proporciona información útil para entusiastas de la tecnología e investigadores. Si deseas obtener más información, deberías consultar el PDF del artículo de Llama 3.1. Esto te ayudará a comprender sus habilidades matemáticas, de razonamiento y su capacidad para trabajar en diferentes idiomas. Llama 3.1 tiene el poder de cambiar cómo funciona la IA. Sus diferentes versiones en Novita.AI ofrecen grandes oportunidades para utilizar esta tecnología. Explora la IA avanzada con Llama 3.1 para un cambio notable.
Preguntas frecuentes
¿Se puede usar Llama 3.1 para generar contenido creativo?
Sí, Llama 3.1 puede generar contenido creativo. Sus funciones de IA generativa le permiten crear diferentes tipos de texto. Esto incluye poemas, guiones e incluso música. Esto muestra lo versátil que es en muchos usos creativos.
¿Cómo maneja Llama 3.1 la privacidad del usuario y la seguridad de los datos?
Llama 3.1 cuenta con Llama Guard para garantizar la privacidad del usuario y la seguridad de los datos, promoviendo el uso responsable de la IA. Previene el mal uso, respalda decisiones éticas y emplea cifrado para la seguridad de los datos.
¿Es Llama 3.1 mejor que GPT-4?
Si priorizas la precisión y eficiencia en tareas de codificación, Llama 3 podría ser la mejor opción.
¿Qué es Llama 3.1 405B?
Los modelos Llama 3.1, con 8B, 70B y 405B de parámetros, muestran un rendimiento superior en benchmarks de la industria y proporcionan nuevas capacidades para aplicaciones de IA generativa.
¿Por qué llama es un gran avance?
Llama, un avance significativo en IA, ofrece capacidades impresionantes y accesibilidad abierta. Su lanzamiento democratiza la investigación en IA, fomentando la creatividad y la colaboración para impulsar la innovación en diversos dominios.
Publicado originalmente en Novita AI
Novita AI es la plataforma integral en la nube que impulsa tus ambiciones de IA. API integradas, sin servidor, instancia GPU: las herramientas rentables que necesitas. Elimina la infraestructura, comienza gratis y haz realidad tu visión de IA.
Lectura recomendada
1.Mejora tus proyectos con la integración de la API de Llama 3.1
