O colapso de modelos é um fenómeno observado em estudos de inteligência artificial, no qual modelos de aprendizagem de máquina degradam-se gradualmente devido a erros provenientes de dados sintéticos não curados ou do treino com base nos resultados de outro modelo, como versões anteriores do próprio modelo. Não está claro até que ponto o fenómeno ameaça o desenvolvimento a longo prazo destes modelos, e algumas técnicas foram propostas para mitigar o efeito.
Características Shumailov et al. cunharam o termo para descrever dois estágios específicos na degradação de modelos de aprendizado de máquina: colapso inicial do modelo e colapso tardio do modelo:
No colapso inicial do modelo, o modelo começa a perder informações sobre as caudas da distribuição – afetando principalmente os dados minoritários. Trabalhos posteriores destacaram que o colapso inicial do modelo é difícil de perceber, uma vez que o desempenho geral pode parecer melhorar, enquanto o modelo perde desempenho nos dados minoritários. No colapso tardio do modelo, o modelo perde uma proporção significativa do seu desempenho, confundindo conceitos e perdendo a maior parte da sua variância.
Mecanismo A utilização de dados sintéticos como dados de treino pode levar a problemas com a qualidade e a fiabilidade do modelo treinado. O colapso de modelos ocorre por três razões principais:
erros de aproximação funcional erros de amostragem erros de aprendizagem É importante ressaltar que isto ocorre até mesmo nos modelos mais simples, onde nem todas as fontes de erro estão presentes. Em modelos mais complexos, os erros frequentemente acumulam-se, levando a um colapso mais rápido.
Divergência sobre o impacto no mundo real
Alguns investigadores e comentadores sobre colapso de modelos alertam que o fenómeno pode ameaçar fundamentalmente o desenvolvimento futuro da IA generativa: à medida que os dados gerados por IA são compartilhados na Internet, eles inevitavelmente acabarão em futuros conjuntos de dados de treino, que muitas vezes são coletados da Internet. Se o treino em "desleixo de IA" (grandes quantidades de dados sintéticos não rotulados) inevitavelmente levar ao colapso de modelos, isto poderá, portanto, representar um problema difícil. No entanto, recentemente, outros investigadores discordaram deste argumento, mostrando que, se os dados sintéticos se acumularem juntamente com os dados gerados por humanos, o colapso do modelo é evitado. Os investigadores argumentam que os dados que se acumulam ao longo do tempo são uma descrição mais realista da realidade do que excluir todos os dados existentes todos os anos, e que o impacto no mundo real do colapso do modelo pode não ser tão catastrófico quanto se temia. Uma vertente alternativa da literatura investiga o uso de detetores de aprendizagem de máquina e marca d'água para identificar dados gerados por modelos e filtrá-los.
Modelos matemáticos do fenómeno
Impacto em modelos de linguagem de grande escala No contexto de modelos de linguagem de grande escala (LLM), investigações descobriram que o treino de LLMs em texto gerado por predecessores — modelos de linguagem são treinados em dados sintéticos produzidos por modelos anteriores — causa uma diminuição consistente na diversidade lexical, sintática e semântica dos resultados do modelo ao longo de iterações sucessivas, notavelmente notável para tarefas que exigem altos níveis de criatividade.
Ver também Perda de geração Inteligência artificial generativa
Notas e referências
Notas
Referências

