Agora vocĂȘ pode soar o alarme caso a IA se comporte mal


Escrita LaboratĂłrio de IA cada semana significa que ocasionalmente encontro modelos de IA que se comportam seriamente e bizarramente. Normalmente, nĂŁo hĂĄ nada a ser feito a respeito, exceto compartilhar essas histĂłrias com vocĂȘ. Mas isso poderĂĄ mudar em breve.

Um grupo de pesquisadores de IA criou um crowdsourcing siteRelatĂłrio de falhas para IA (FLARE-AI), para relatar e rastrear danos de IA. Se, por exemplo, um chatbot gerar malware ou uma receita para fazer bombas, vazar informaçÔes pessoais ou desencadear pensamentos delirantes nos usuĂĄrios, o FLARE-AI poderĂĄ ser usado para soar o alarme. O cĂłdigo-fonte aberto por trĂĄs do sistema permite que outras pessoas verifiquem um problema e encaminhem relatĂłrios para fabricantes de modelos, bem como para organizaçÔes como a MITRE, uma organização sem fins lucrativos que rastreia problemas com sistemas tĂ©cnicos. É um pouco como o Downdetector, que compila relatĂłrios de usuĂĄrios em tempo real para interrupçÔes globais de serviços que afetam aplicativos e sites.

O site é mais um passo no trabalho contínuo do grupo com relatórios de IA, sobre o qual escrevi pela primeira vez no ano passado. Os membros do grupo também consultaram sobre uma projeto de lei do Congresso anunciado em junhoo que faria com que o governo dos EUA assumisse um papel central no rastreamento deste tipo de mau comportamento da IA.

“Neste momento, nĂŁo existe uma forma centralizada e responsĂĄvel de reportar falhas nos sistemas de IA”, afirma Avijit Ghosh, um inteligĂȘncia artificial pesquisador de polĂ­ticas da HuggingFace que co-liderou o desenvolvimento do FLARE-AI com cientistas da computação Elaine Zhu e Shayne Longpre.

O sistema de alarme foi desenvolvido em colaboração com 49 especialistas em IA de 32 organizaçÔes diferentes. Em um papel delineando o trabalho, os investigadores argumentam que a sua iniciativa pode revelar-se crucial à medida que a IA for adoptada de forma mais ampla e à medida que os sistemas de agentes ganhem maior poder. A falta de uma forma consistente de relatar falhas de IA é um problema significativo, acreditam eles.

“Acho que Ă© uma iniciativa muito boa”, diz Jessica Ji, pesquisadora do think tank Center for Security and Emerging Technology. Ji diz que os investigadores tĂȘm razĂŁo ao observar que os mecanismos de comunicação existentes estĂŁo fragmentados e que os modelos de IA sĂŁo caixas negras. “Apoio qualquer coisa que torne a IA mais transparente”, diz ela.

Embora bugs e problemas de segurança cibernĂ©tica recebam muita atenção—especialmente ultimamente—Ghosh me disse que os problemas com sistemas de IA abrangem tĂłpicos como danos psicolĂłgicos, discriminação ou preconceito e desinformação. Ele acrescenta que diferentes empresas tĂȘm padrĂ”es diferentes em relação a essas questĂ”es, o que significa que alguns problemas passam despercebidos. “Na ausĂȘncia de um sistema de divulgação coordenado, nĂŁo existem mecanismos externos para impor a transparĂȘncia”, diz Ghosh.

Uma série de incidentes recentes envolvendo ferramentas populares de IA mostra quão facilmente a tecnologia pode estragar.

Esta semana, uma empresa chamada LayerX divulgou uma maneira para enganar navegadores da web com infusão de IA, incluindo Atlas da OpenAI e Comet da Perplexity, para que saltem suas grades de proteção. Convencer o modelo de IA por trás do navegador de que ele estava jogando, por exemplo, poderia fazer com que o navegador se tornasse desonesto e tentasse hackear um site. (As empresas responsáveis ​​pelos navegadores afetados corrigiram o problema, diz LayerX.) E em abril deste ano, Johann Rehberger, pesquisador de segurança, descobriu um maneira de enganar Claude a divulgar dados pessoais por meio de imagens geradas pelo ChatGTP.

A IA também introduz novos tipos de problemas bizarros. No ano passado, a OpenAI foi forçada a atualizar seus modelos depois de descobrir que eles eram excessivamente bajuladores, o que às vezes parecia encorajar o pensamento delirante.

Rumman Chowdhury, CEO e fundador da Humane Intelligence PBC, diz que o FLARE-AI pode ser uma forma Ăștil para muitos desenvolvedores de IA implementarem formas de relatar problemas com suas ferramentas. Mas ela acrescenta que tais iniciativas muitas vezes trazem sĂ©rios desafios.



Source link