Pular para o conteúdo principal

O Iceberg da Inteligência Artificial nos Arquivos

 

Cadernos de Pesquisa em Preservação Digital Sistêmica e Cadeia de Custódia Digital Arquivística

Post 3 — O Iceberg da Inteligência Artificial nos Arquivos

Nos últimos anos, a Inteligência Artificial tornou-se uma das tecnologias mais discutidas do mundo. Sistemas como ChatGPT, Gemini, Claude, Llama e outros modelos generativos passaram a produzir respostas, resumos, análises e conteúdos em velocidades nunca antes imaginadas.

Mas uma pergunta raramente é feita:

Sobre quais documentos essas Inteligências Artificiais estão aprendendo?

A resposta parece simples.

A maior parte dos modelos atuais aprende a partir de conteúdos disponíveis na Web, bases abertas, publicações indexadas, repositórios acessíveis e grandes conjuntos de dados utilizados durante o treinamento.

Entretanto, para os Arquivos, essa resposta revela um problema muito maior.

Grande parte da memória documental da humanidade não está na Web.

Ela está nos Arquivos.

Está nos fundos documentais.

Nos processos administrativos.

Nos documentos permanentes.

Nos acervos históricos.

Nos repositórios arquivísticos digitais confiáveis.

Nos Sistemas Informatizados de Gestão Arquivística de Documentos.

Nos pacotes de preservação digital.

Nos metadados de proveniência.

Nas evidências documentais produzidas pelas instituições.

E essa imensa massa documental permanece praticamente invisível para as Inteligências Artificiais atuais.

É justamente por isso que passamos a utilizar uma metáfora que tem orientado nossas discussões no Grupo CNPq UFAL PDS & Ged/A:

O Iceberg da Inteligência Artificial nos Arquivos

A parte visível do iceberg representa aquilo que as IAs conseguem acessar atualmente:

  • páginas da Web;

  • redes sociais;

  • portais institucionais;

  • dados abertos;

  • artigos indexados;

  • conteúdos disponíveis aos mecanismos de busca.

Mas abaixo da superfície encontra-se uma porção muito maior:

  • fundos documentais;

  • processos administrativos;

  • documentos arquivísticos digitais;

  • acervos permanentes;

  • documentos restritos;

  • pacotes AIP;

  • metadados PREMIS;

  • bases de dados arquivísticas;

  • evidências documentais produzidas pelas organizações.

Paradoxalmente, é justamente essa parte invisível que contém uma parcela significativa da memória institucional, administrativa, jurídica, científica e histórica da sociedade.

Assim, as Inteligências Artificiais atuais respondem perguntas sem considerar grande parte dos documentos que efetivamente registram as ações das organizações.

Em outras palavras:

as IAs conhecem informações; os Arquivos preservam evidências.

Essa distinção é fundamental.

A informação pode circular, ser reproduzida, reinterpretada ou descontextualizada.

A evidência arquivística, por sua vez, está vinculada à proveniência, ao contexto, à organicidade, à autenticidade e à custódia.

É exatamente nesse ponto que a Arquivologia possui uma contribuição singular para o futuro da Inteligência Artificial.

A questão não é apenas disponibilizar documentos para as IAs.

A questão é permitir que as IAs recuperem evidências documentais autênticas.

E isso exige muito mais do que indexação tradicional.

Exige novos modelos de integração entre Arquivos e Inteligência Artificial.

Nos últimos anos, arquiteturas baseadas em RAG (Retrieval-Augmented Generation) passaram a oferecer um caminho promissor.

Em vez de responder apenas com base no treinamento prévio dos modelos, os sistemas RAG recuperam documentos específicos e utilizam essas evidências como base para a geração das respostas.

Quando essa arquitetura é aplicada aos Arquivos, abre-se uma nova fronteira.

Imagine um ecossistema composto por:

  • SIGAD;

  • RDC-Arq;

  • Archivematica;

  • AtoM;

  • ElasticSearch Vetorial;

  • modelos locais executados por Ollama;

  • mecanismos de anonimização e proteção de dados;

  • metadados arquivísticos preservados ao longo do ciclo de vida.

Nesse cenário, a Inteligência Artificial deixa de responder exclusivamente a partir da Web e passa a dialogar diretamente com os próprios fundos documentais da instituição.

Mais importante ainda:

essa recuperação pode ocorrer sem que os documentos precisem sair do ambiente arquivístico confiável.

Essa característica possui implicações estratégicas.

Permite:

  • reduzir riscos de vazamento de dados;

  • apoiar a conformidade com a LGPD;

  • preservar a soberania dos dados;

  • respeitar o princípio da territorialidade;

  • proteger documentos sensíveis;

  • manter a custódia arquivística;

  • controlar os processos de anonimização.

Mas talvez o benefício mais importante seja outro.

Ao recuperar informações diretamente de documentos autênticos preservados em ecossistemas arquivísticos confiáveis, torna-se possível reduzir significativamente:

  • alucinações;

  • respostas sem contexto;

  • inferências baseadas em informações incompletas;

  • vieses decorrentes da ausência de evidências documentais.

A IA não passa a ser infalível.

Mas passa a operar sobre bases documentais muito mais sólidas.

Nesse contexto, a Inteligência Artificial deixa de ser apenas uma tecnologia de geração de respostas.

Ela passa a atuar como uma camada avançada de acesso ao patrimônio documental preservado pelas instituições.

E isso nos leva a uma provocação final.

Talvez a primeira geração de Inteligências Artificiais tenha aprendido com a Web.

Mas a próxima geração poderá aprender com os Arquivos.

Não de qualquer arquivo.

Mas de documentos autênticos, preservados mediante a Preservação Digital Sistêmica (PDS), mantidos sob uma Cadeia de Custódia Digital Arquivística (CCDA) e contextualizados por Arquivistas.

Porque, no futuro, o diferencial não será apenas possuir Inteligência Artificial.

Será possuir evidências autênticas para alimentá-la.


Uma hipótese para debate

E se o verdadeiro desafio da Inteligência Artificial nos Arquivos não for ensinar IA aos Arquivistas, mas ensinar os Arquivos à Inteligência Artificial?

No próximo texto desta série discutiremos como a Preservação Digital Sistêmica pode se tornar a infraestrutura estratégica para a Inteligência Artificial Arquivística.

Comentários

Postagens mais visitadas deste blog

Inovação Sustentada

 Inovação Sustentada: Construindo o Futuro com Fundamentos Sólidos No dinâmico cenário da transformação digital, somos constantemente bombardeados com conceitos como "disrupção" e "inovação". Mas, você já se perguntou sobre a Inovação Sustentada e por que ela é tão importante, especialmente em áreas que exigem confiabilidade e estabilidade, como a Arquivologia? O que é Inovação Sustentada? A inovação sustentada é um tipo de inovação que se baseia em referenciais sólidos, ou seja, está profundamente enraizada no arcabouço teórico, epistêmico e metodológico de uma área de conhecimento específica. Em vez de buscar o "novo pelo novo", ela se concentra em aprimorar produtos e serviços já existentes, atendendo às necessidades dos consumidores atuais e seguindo as definições originais de desempenho e qualidade do mercado. Isso significa que a inovação sustentada é o resultado de um estudo minucioso, que harmoniza as demandas do mercado com o rigor científico. Por...

Novas versões do Modelo OAIS (ISO 14721) e normas relacionadas, ISO 16363 e ISO 16919 que foram atualizadas agora no final de 2024

Novas versões do Modelo OAIS (ISO 14721) e normas relacionadas, ISO 16363 e ISO 16919 que foram atualizadas agora no final de 2024 (Links para downloads abaixo): Modelo OAIS - ISO 14721 (versão 2024): CCSDS 650.0-M-3 https://lnkd.in/e2KZHWzn Reference Model for an Open Archival Information System (OAIS) * Modelo de Referência para um Sistema Aberto de Arquivamento de Informações (OAIS) ISO 16363 - Auditoria e Certificação dos RDC's - Repositórios Digitais Confiáveis CCSDS 652.0-M-2 https://lnkd.in/e-fD2Ken Audit and Certification of Trustworthy Digital Repositories (ISO 16363) * Auditoria e Certificação de Repositórios Digitais Confiáveis (ISO 16363) ISO 16919 - Requisitos para Organizações de Auditoria e Certificação baseada na ISO 16363 CCSDS 652.1-M-3 https://lnkd.in/ep-SBg4Q Requirements for Bodies Providing Audit and Certification of Candidate Trustworthy Digital Repositories (ISO 16919) * Requisitos para Organizações que Provém Auditoria e Certificação de Candidatos a Rep...

CNA Salvador 2024

ATENÇÃO! O compromisso bienal dos arquivistas no Brasil  já tem data e local: 14 a 18 de outubro de 2024 no Auditório de Eventos do Quality Hotel e Suítes São Salvador em Salvador/BA! O tema é fundamentado nos cenários que compõem a Epistemologia arquivística, e dentre estes, nas últimas décadas, a Arquivologia tem dialogado de modo profícuo com a Ciência da Informação, Tecnologia da informação e áreas correlatas.  Na contemporaneidade, o movimento na cena da ciência dos arquivos parece apontar para uma nova conjuntura, em que a sua episteme apresenta entrelaços e perspectivas oportunas e desafiadoras com a emergente tecnologia disruptiva, que envolve a Ciência de Dados e a Inteligência Artificial.  Diante dessa possível relação interdisciplinar, cabe à comunidade arquivística fazer os questionamentos:  Como se estabelecem os conceitos de informação e documento arquivístico neste cenário?  Os dados podem constituir-se objeto da área?  Qual o papel do arquiv...