Inteligência artificial amigável

Traduzido do inglês

Inteligência artificial amigável (IA amigável ou FAI) é uma forma hipotética de inteligência artificial geral projetada para ter um efeito positivo sobre a humanidade ou alinhar-se com os interesses humanos. É um tópico central na ética da IA, focando em como garantir praticamente que sistemas superinteligentes permaneçam seguros e benéficos.

Inteligência artificial amigável (IA amigável ou FAI) é uma forma hipotética de inteligência artificial geral (AGI) que teria um efeito positivo (benigno) sobre a humanidade ou, pelo menos, estaria alinhada com os interesses humanos, como fomentar a melhoria da espécie humana. É uma parte da ética da inteligência artificial e está intimamente relacionada à ética de máquinas. Enquanto a ética de máquinas se preocupa com como um agente artificialmente inteligente deveria se comportar, a pesquisa em inteligência artificial amigável foca em como trazer esse comportamento à prática e garantir que ele seja adequadamente restringido.

O termo foi cunhado por Eliezer Yudkowsky, mais conhecido por popularizar a ideia, para discutir agentes artificiais superinteligentes que implementam de forma confiável os valores humanos. O principal livro-texto de inteligência artificial de Stuart J. Russell e Peter Norvig, Artificial Intelligence: A Modern Approach, descreve a ideia: Yudkowsky (2008) entra em mais detalhes sobre como projetar uma IA amigável. Ele afirma que a amabilidade (um desejo de não prejudicar humanos) deve ser projetada desde o início, mas que os projetistas devem reconhecer tanto que seus próprios projetos podem ser falhos quanto que o robô aprenderá e evoluirá ao longo do tempo. Assim, o desafio é um de design de mecanismo - definir um mecanismo para evoluir sistemas de IA sob um sistema de freios e contrapesos, e dar aos sistemas funções de utilidade que permaneçam amigáveis diante de tais mudanças.

"Amigável" é usado neste contexto como terminologia técnica e designa agentes que são seguros e úteis, não necessariamente aqueles que são "amigáveis" no sentido coloquial. O conceito é invocado principalmente no contexto de discussões sobre agentes artificiais que se autoaperfeiçoam recursivamente e que explodem rapidamente em inteligência, com o argumento de que essa tecnologia hipotética teria um impacto grande, rápido e difícil de controlar sobre a sociedade humana.

Riscos da IA Não Amigável

As raízes da preocupação com a inteligência artificial são muito antigas. Kevin LaGrandeur mostrou que os perigos específicos da IA podem ser vistos na literatura antiga sobre servos humanoides artificiais, como o golem, ou os proto-robôs de Gerbert de Aurillac e Roger Bacon. Nessas histórias, a extrema inteligência e poder dessas criações humanoides entram em conflito com seu status de escravos (que por natureza são vistos como sub-humanos) e causam conflitos desastrosos. Em 1942, esses temas levaram Isaac Asimov a criar as "Três Leis da Robótica" - princípios gravados em todos os robôs de sua ficção, destinados a impedi-los de se voltar contra seus criadores ou permitir que eles sofram danos.

Nos tempos modernos, à medida que a perspectiva de IA superinteligente se aproxima, o filósofo Nick Bostrom disse que sistemas de IA superinteligentes com objetivos que não estão alinhados com a ética humana são intrinsecamente perigosos, a menos que medidas extremas sejam tomadas para garantir a segurança da humanidade. Ele colocou assim: "Basicamente, devemos assumir que uma 'superinteligência' seria capaz de alcançar quaisquer objetivos que tivesse. Portanto, é extremamente importante que os objetivos com os quais a dotamos, e todo o seu sistema de motivação, sejam 'amigáveis aos humanos'."

Em 2008, Eliezer Yudkowsky pediu a criação de "IA amigável" para mitigar o risco existencial de inteligência artificial avançada. Ele explica: "A IA não te odeia, nem te ama, mas você é feito de átomos que ela pode usar para outra coisa."

Steve Omohundro diz que um sistema de IA suficientemente avançado exibirá, a menos que seja explicitamente contrabalançado, uma série de "impulsos" básicos, como aquisição de recursos, autopreservação e autoaperfeiçoamento contínuo, devido à natureza intrínseca de qualquer sistema orientado a objetivos, e que esses impulsos, "sem precauções especiais", farão a IA exibir comportamento indesejado. Alexander Wissner-Gross diz que IAs impulsionadas a maximizar sua liberdade futura de ação (ou entropia de caminho causal) podem ser consideradas amigáveis se seu horizonte de planejamento for mais longo que um certo limiar, e não amigáveis se seu horizonte de planejamento for mais curto que esse limiar.

Luke Muehlhauser, escrevendo para o Machine Intelligence Research Institute, recomenda que pesquisadores de ética de máquinas adotem o que Bruce Schneier chamou de "mentalidade de segurança": em vez de pensar em como um sistema funcionará, imagine como ele poderia falhar. Por exemplo, ele sugere que mesmo uma IA que apenas faz previsões precisas e se comunica por meio de uma interface de texto pode causar danos não intencionais. Em 2014, Luke Muehlhauser e Nick Bostrom sublinharam a necessidade de "IA amigável"; no entanto, as dificuldades em projetar uma superinteligência "amigável", por exemplo, por meio da programação de pensamento moral contrafactual, são consideráveis.

Vontade Extrapolada Coerente

Yudkowsky avança o modelo de Vontade Extrapolada Coerente (CEV). Segundo ele, nossa vontade extrapolada coerente é "nosso desejo se soubéssemos mais, pensássemos mais rápido, fôssemos mais as pessoas que gostaríamos de ser, tivéssemos crescido juntos mais longe; onde a extrapolação converge em vez de divergir, onde nossos desejos se coadunam em vez de interferir; extrapolada como desejamos que fosse extrapolada, interpretada como desejamos que fosse interpretada".

Em vez de uma IA amigável ser projetada diretamente por programadores humanos, ela deve ser projetada por uma "IA semente" programada para primeiro estudar a natureza humana e depois produzir a IA que a humanidade desejaria, dado tempo e insight suficientes, para chegar a uma resposta satisfatória. O apelo a um objetivo através da natureza humana contingente (talvez expresso, para fins matemáticos, na forma de uma função de utilidade ou outro formalismo de teoria da decisão), como fornecendo o critério último de "amabilidade", é uma resposta ao problema metaético de definir uma moralidade objetiva; a vontade extrapolada pretende ser o que a humanidade objetivamente desejaria, considerando todas as coisas, mas só pode ser definida em relação às qualidades psicológicas e cognitivas da humanidade atual, não extrapolada.

Outras Abordagens

Steve Omohundro propôs uma abordagem de "andaime" para a segurança da IA, na qual uma geração de IA comprovadamente segura ajuda a construir a próxima geração comprovadamente segura. Seth Baum argumenta que o desenvolvimento de inteligência artificial ou inteligência artificial geral segura e socialmente benéfica é uma função da psicologia social das comunidades de pesquisa em IA e, portanto, pode ser restringido por medidas extrínsecas e motivado por medidas intrínsecas. Motivações intrínsecas podem ser fortalecidas quando mensagens ressoam com desenvolvedores de IA; Baum argumenta que, em contraste, "mensagens existentes sobre IA benéfica nem sempre são bem enquadradas". Baum defende "relações cooperativas e enquadramento positivo dos pesquisadores de IA" e adverte contra caracterizar pesquisadores de IA como "não querendo buscar designs benéficos".

Em seu livro Human Compatible, o pesquisador de IA Stuart J. Russell lista três princípios para guiar o desenvolvimento de máquinas benéficas. Ele enfatiza que esses princípios são apenas um ponto de partida para uma nova abordagem da IA que prioriza a compatibilidade humana. Os princípios focam em garantir que o objetivo primário da máquina seja a satisfação das preferências humanas, que ela seja incerta sobre essas preferências e que busque informações para melhorar sua compreensão delas.

Relação com a Ética de Máquinas

A IA amigável está intimamente relacionada à ética de máquinas, mas os dois campos têm ênfases diferentes. A ética de máquinas se preocupa com o comportamento moral de agentes artificiais, fazendo perguntas como "o que uma IA deveria fazer em uma determinada situação?" A pesquisa em IA amigável, por outro lado, é mais prática, focando em como projetar e construir sistemas de IA que sejam seguros e benéficos desde o início. Isso inclui trabalho em alinhamento de valores, interpretabilidade e robustez. O campo se baseia em insights de inteligência artificial, aprendizado de máquina e aprendizado profundo, e é cada vez mais relevante à medida que organizações como OpenAI, Anthropic e Google DeepMind desenvolvem sistemas avançados de IA. Pesquisadores como Michael I. Jordan e Melanie Mitchell contribuíram para discussões sobre segurança e ética da IA, destacando a necessidade de consideração cuidadosa dos impactos sociais da IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·ethics·existential-risk·ai-safety
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico