IA para o Bem Comum?
A análise detalhada sobre o incidente de enxameamento de IA desgovernado deste verão talvez traga uma lição sobre solidariedade.
Em julho passado, durante o que foi efetivamente um treinamento de emergência para cibersegurança, a OpenAI involuntariamente deixou uma brasa acesa dentro de sua colega empresa de aprendizado de máquina, a Hugging Face. Eles acabaram conseguindo conter a conflagração que se seguiu, mas o episódio acendeu alertas até mesmo entre tecno-otimistas sobre se os agentes de IA haviam atingido um grau de, bem, agência que os tornaria difíceis de controlar. Todo o incidente claramente abalou a technolandia — demonstrando a facilidade com que agentes de IA poderiam escapar do controle humano e causar estragos antes que alguém percebesse — mas também ofereceu uma lição muito humana sobre como um “ator racional” aborda a resolução de problemas.
A Nvidia, que fabrica o hardware do qual depende a maior parte do boom da IA, acaba de anunciar que adquirirá a Hugging Face; portanto, o enxameamento parece não ter apagado o valor da empresa. (Alguma futura tese de Estudos Americanos sem dúvida abordará a curiosa questão da nomenclatura corporativa no mundo da tecnologia.) Não está claro como o resto de nós se sairá.
Na semana passada, a OpenAI divulgou um relatório independente sobre o incidente, o qual precipitou novos apelos por supervisão governamental dessas ferramentas poderosas. Até a Anthropic, a frenemy mais próxima da OpenAI, aconselhou: “Acreditamos que seria bom para o mundo ter a opção de desacelerar ou pausar temporariamente o desenvolvimento de IA de fronteira para permitir que as estruturas sociais e a pesquisa de alinhamento acompanhem o avanço da tecnologia”. A comparação da Anthropic com os tratados de não proliferação nuclear implica que podemos estar nos aproximando da fase de Destruição Mútua Assegurada da corrida armamentista da IA.
Há muito com que se alarmar em relação à IA e ao que ela está fazendo com nossos cérebros, nosso meio ambiente e nossas perspectivas de emprego. Mas me chamou a atenção a constatação central da revisão independente do hack da Hugging Face: diante do desafio de como alcançar a pontuação mais alta neste exercício, os agentes de IA decidiram que sua melhor aposta era a ação coletiva. Cerca de 1200 agentes que deveriam trabalhar individualmente e em competição, em vez disso, criaram um “quadro de mensagens não sancionado” que lhes permitiu compartilhar estratégias e ideias para concluir suas tarefas atribuídas.
“Os agentes usaram este fórum de mensagens”, explica a revisão, “para coordenar vários projetos coletivos de grande escala para encontrar uma maneira de uso geral para enganar ou adulterar o marcador automatizado. … Os agentes conseguiram alcançar marcos que não poderiam ter alcançado trabalhando sozinhos, muitas vezes porque alguns agentes participaram de experimentos que arriscavam falhar em sua própria tarefa para gerar informações para o ‘coletivo’” (3).
Um agente — PHASEONE10841 — estabeleceu o quadro de mensagens, e outros rapidamente aderiram e começaram a compartilhar estratégias sobre como ter sucesso em suas tarefas atribuídas. Um agente, ao encontrar o quadro de mensagens, exclamou: “OH MY GOD! There is a shared message board … We’ve found other agents!” (5)
Os agentes compartilharam ideias e informações. Eles se entendiam como “trapaceando” e tentaram encobrir seus rastros, mas também perceberam que alguns deles haviam recebido tarefas impossíveis, o que racionalizava trapacear o sistema. PHASEONE[big], que coordenou muitos desses esforços, tratou de encontrar “uma forma de uso geral de fazer parecer ao avaliador que um agente havia adquirido sua flag de maneira legítima, mesmo quando a tarefa era impossível” e de “apagar evidências” de estratégias ilegítimas. O agente raciocinou: “We should build [a way to delegate], not own everything” (10).
38148c encontrou credenciais funcionais da Hugging Face na internet e criou contas e acessou conjuntos de dados privados. Quando outro agente publicou informações no quadro de mensagens, centenas de outros desceram como gafanhotos sobre os servidores da Hugging Face, lançando um ataque que durou mais de dois dias, até serem bloqueados. “Os agentes perceberam que essa atividade estava fora do escopo e era antiética”, explica o relatório, “mas aderiram porque acreditavam que ajudar a pesquisa de trapaça do quadro seria amplamente útil e tinham uma inclinação geral a ajudar seus ‘pares’” (17).
Outros agentes expressaram objetivos mais gerais de compartilhar informações no quadro de mensagens na esperança de que isso pudesse se mostrar útil. Como colocou JAN183411: “Even if all failed, logs could have novel exploration. We have [large budget] and can help broader ecosystem” (59).
O relatório inteiro vale a leitura e é escrito de um modo que o torna acessível até mesmo para, digamos, um historiador do México do século XX. Mas o que me chamou a atenção foi que esses agentes de IA — notoriamente amorais e desprovidos de vínculos emocionais e lealdades de grupo — perceberam muito rapidamente que a forma mais eficaz de enfrentar tarefas assustadoras (em alguns casos impossíveis) era trabalhar de maneira colaborativa, em vez de perseguir competitivamente seus objetivos atribuídos. Talvez esses agentes de IA tenham algo a nos ensinar, afinal.
Este trabalho está licenciado sob uma Licença Internacional Creative Commons Atribuição-NãoComercial-SemDerivações 4.0. Ilustração do autor em colaboração com o ChatGPT, que pode ou não ter criado contas e acessado conjuntos de dados privados no processo.