Introdução
Como e por que modelos de linguagem maiores fazem aprendizado em contexto de forma diferente? Neste artigo, exploraremos o conceito de “aprendizado em contexto” (ICL), discutiremos as descobertas mais recentes sobre os comportamentos de aprendizado em contexto de modelos de diferentes tamanhos em português claro e abordaremos maneiras de alavancar diferentes comportamentos de ICL dos LLMs. Se você está interessado, continue lendo!
O que é “aprendizado em contexto”?
Aprendizado em contexto é uma capacidade empolgante que emergiu do desenvolvimento de modelos de linguagem de grande escala (LLMs). Refere-se à habilidade desses modelos de ter um bom desempenho em tarefas novas e nunca vistas, baseando-se apenas em uma breve série de exemplos de tarefas fornecidos no contexto de entrada. Isso é uma façanha notável, pois os modelos conseguem se adaptar e aplicar seu conhecimento a situações novas sem exigir qualquer atualização ou ajuste fino em seus parâmetros subjacentes.
O aspecto fundamental do aprendizado em contexto é que o modelo aproveita as informações contextuais fornecidas como parte do prompt de entrada para informar sua resposta, em vez de depender apenas de seu conhecimento pré-existente ou treinamento. Por exemplo, se você apresentar a um modelo de linguagem alguns exemplos de como resolver equações lineares, ele poderá usar esse contexto para resolver uma nova equação linear que nunca encontrou antes. O modelo consegue inferir o padrão subjacente e aplicá-lo ao novo problema, sem precisar ser explicitamente treinado naquele tipo específico de equação.

Quais são os benefícios do “aprendizado em contexto”?
Versatilidade e adaptabilidade
- O ICL permite que modelos de linguagem de grande escala sejam aplicados a uma ampla variedade de tarefas e domínios sem necessidade de re-treinamento extensivo.
- Isso permite que os modelos expandam continuamente suas capacidades aprendendo novas habilidades por meio do ICL.
Eficiência de amostras
- O ICL requer relativamente poucos exemplos para aprender novas tarefas, reduzindo as necessidades de dados em comparação com o aprendizado supervisionado tradicional.
- Isso é valioso quando os dados rotulados são escassos ou caros de obter.
Eficiência computacional
- O ICL pode ser realizado com uma única passagem direta pelo modelo, sem atualizações de parâmetros.
- Essa eficiência computacional é importante para aplicações em tempo real e implantações com recursos limitados.
Capacidades emergentes
- Modelos de linguagem de grande escala frequentemente podem ter bom desempenho em tarefas não vistas por meio do ICL, superando o desempenho de modelos treinados explicitamente nessas tarefas.
- Isso sugere que os modelos podem efetivamente aproveitar informações contextuais para resolver novos problemas.
Insights sobre o comportamento do modelo
- Compreender o ICL pode fornecer insights valiosos sobre como os modelos de linguagem de grande escala representam e utilizam o conhecimento.
- Isso pode informar o desenvolvimento de sistemas de IA mais robustos e confiáveis.
Uma grande descoberta: modelos de linguagem maiores fazem aprendizado em contexto de forma diferente
O artigo “Larger Language Models Do In-context Learning Differently” de Jerry Wei, Jason Wei, Yi Tay e outros discute se o aprendizado em contexto depende mais de prioris semânticos do pré-treinamento ou do aprendizado de mapeamentos entrada-rótulo a partir dos exemplares.
Se os detalhes da pesquisa não lhe interessam, apenas aceite esta conclusão e vá para a próxima seção: quanto maior o modelo de linguagem, menos ele depende de prioris semânticos (o significado e as associações inerentes que os modelos de linguagem aprendem durante o pré-treinamento) e mais capaz ele é de aprender a partir de contextos de entrada.
Quero me aprofundar
Contexto
- Modelos de linguagem podem realizar várias tarefas downstream por meio do aprendizado em contexto (ICL), onde recebem alguns exemplares como parte do prompt.
- Há debate se o ICL depende mais de prioris semânticos do pré-treinamento ou do aprendizado de mapeamentos entrada-rótulo a partir dos exemplares.
Configurações teóricas
Os autores investigam duas configurações para sondar a interação entre prioris semânticos e mapeamentos entrada-rótulo:
- ICL com rótulos invertidos: Os rótulos nos exemplares são invertidos, forçando os modelos a sobrescrever prioris semânticos.
- ICL com rótulos semanticamente não relacionados (SUL-ICL): Os rótulos são semanticamente não relacionados à tarefa, removendo prioris semânticos.
Design do experimento
- Experimentos conduzidos em 7 tarefas de PNL em 5 famílias de modelos (GPT-3, InstructGPT, Codex, PaLM, Flan-PaLM) de tamanhos variados.
- Avaliação de desempenho nas configurações de ICL regular, ICL com rótulos invertidos e SUL-ICL.

Principais descobertas
- ICL com rótulos invertidos: Modelos pequenos não conseguem sobrescrever prioris semânticos, mas modelos grandes podem aprender a seguir rótulos de exemplares invertidos.
- SUL-ICL: Modelos pequenos dependem mais de prioris semânticos, enquanto modelos grandes podem aprender mapeamentos entrada-rótulo sem prioris semânticos.

- A capacidade de sobrescrever prioris semânticos e aprender mapeamentos entrada-rótulo emerge com a escala do modelo.
- O ajuste de instrução fortalece o uso de prioris semânticos mais do que a capacidade de aprender mapeamentos entrada-rótulo.
Por que modelos de linguagem maiores fazem aprendizado em contexto de forma diferente?
Outro artigo, “Why Do Larger Language Models Do In-context Learning Differently?” de Zhenmei Shi, Junyi Wei, Zhuoyan Xu e Yingyu Liang, discute as razões por trás dos diferentes desempenhos de aprendizado em contexto de LLMs grandes e pequenos. Aqui oferecemos duas versões: Versão em Português Claro e Versão Profissional. Sinta-se à vontade para escolher a versão que melhor lhe convier.
Prefiro a versão em português claro
Este artigo explica o “porquê” por trás dos diferentes comportamentos de ICL de modelos de linguagem maiores e menores:
A razão principal está relacionada a como os modelos alocam atenção entre diferentes características durante o processo de aprendizado em contexto.
Modelos menores tendem a focar mais nas características importantes e informativas que são relevantes para a tarefa. Eles enfatizam essas características-chave e, portanto, são mais robustos ao ruído ou informações irrelevantes no contexto de entrada.
Em contraste, modelos de linguagem maiores têm capacidade de atender a uma gama mais ampla de características, incluindo aquelas que são menos importantes ou até ruidosas. Embora isso permita que capturem mais informações, também os torna mais suscetíveis a serem distraídos por aspectos irrelevantes ou ruidosos do contexto de entrada.
Essencialmente, os modelos maiores abrangem um conjunto mais amplo de características, tanto relevantes quanto irrelevantes, enquanto os modelos menores priorizam as características mais salientes. Essa diferença na alocação de atenção é o que leva à maior robustez dos modelos menores durante o aprendizado em contexto em comparação com seus equivalentes maiores.
Quero me aprofundar
Contexto da pesquisa
O artigo examina por que modelos de linguagem maiores (LLMs) exibem comportamentos de aprendizado em contexto (ICL) diferentes em comparação com modelos menores. ICL é uma importante capacidade emergente dos LLMs, onde eles podem ter bom desempenho em tarefas não vistas com base em uma breve série de exemplos de tarefas sem atualizar os parâmetros do modelo. Estudos recentes observaram que LLMs maiores tendem a ser mais sensíveis ao ruído no contexto de teste, apresentando desempenho pior do que modelos menores.
Configurações teóricas
Para entender esse fenômeno, o artigo analisa duas configurações estilizadas:
- Regressão linear com transformers lineares de uma camada e uma única cabeça de atenção
- Classificação de paridade com transformers de duas camadas e múltiplas cabeças de atenção
O objetivo é fornecer insights teóricos sobre como o mecanismo de atenção e a escala do modelo afetam o comportamento do ICL.
Para ambas as configurações, os autores fornecem soluções ótimas de forma fechada e caracterizam como o mecanismo de atenção difere entre modelos menores e maiores.
Design do experimento
Os autores conduzem experimentos de aprendizado em contexto em cinco tarefas comuns de PNL usando vários tamanhos das famílias de modelos Llama. Os resultados experimentais são usados para corroborar a análise teórica.
Principais descobertas
- Modelos menores enfatizam características ocultas importantes, enquanto modelos maiores cobrem mais características, incluindo características menos importantes ou ruidosas.
- Modelos menores são mais robustos ao ruído de rótulo e ruído de entrada durante a avaliação, enquanto modelos maiores são mais facilmente distraídos por esses ruídos, levando a um pior desempenho de ICL.

- A análise teórica e os resultados experimentais fornecem insights sobre como o mecanismo de atenção e a escala do modelo afetam o comportamento do ICL, lançando luz sobre o funcionamento interno dos LLMs.
Aproveitando diferentes comportamentos de ICL de LLMs
Reconhecer essas diferenças sutis é crucial para selecionar o modelo apropriado com base nas características dos dados e nos requisitos da tarefa. Como aprendemos nos dois artigos anteriores, modelos menores são mais robustos a entradas ruidosas, pois focam nas características-chave e são menos distraídos por informações irrelevantes. Modelos maiores, em contraste, destacam-se em tarefas que exigem uma compreensão abrangente de diversas características, alavancando seu conhecimento contextual mais amplo.
Portanto, para aproveitar diferentes comportamentos de ICL de LLMs, a Novita AI oferece a desenvolvedores de startups de IA APIs de LLM econômicas e com escalonamento automático, com diferentes opções de modelos de LLM.

Em apenas algumas linhas de código, você pode integrar LLMs poderosos em seus produtos de IA. Sinta-se à vontade para testar as capacidades de diferentes LLMs no Novita AI Playground antes de decidir usar nossas APIs.

Conclusão
Aprendizado em contexto é a capacidade de modelos de linguagem de grande escala (LLMs) de ter bom desempenho em tarefas não vistas com base na entrada, ou seja, no contexto.
Como modelos de linguagem maiores fazem aprendizado em contexto de forma diferente? Quanto maior o modelo de linguagem, menos ele depende de prioris semânticos e mais capaz é de aprender a partir de contextos de entrada.
Por que modelos de linguagem maiores fazem aprendizado em contexto de forma diferente? A principal razão por trás dessas diferenças está relacionada a como os modelos alocam atenção entre diferentes características durante o processo de aprendizado em contexto.
Para aproveitar os comportamentos divergentes de aprendizado em contexto exibidos por diferentes modelos de linguagem, implementar uma API com diversas seleções de modelos de LLM pode ser vantajoso.
Novita AI, a plataforma completa para criatividade sem limites que oferece acesso a mais de 100 APIs. Desde geração de imagens e processamento de linguagem até aprimoramento de áudio e manipulação de vídeo, pagamento conforme o uso econômico, libera você das preocupações com manutenção de GPU enquanto constrói seus próprios produtos. Experimente gratuitamente.
