Blog do ferdy — extração de dados de artigos científicos para revisão sistemática Entrar no ferdy
ferdyblog

O que é o ferdy e como ele extrai dados de artigos em PDF

Quem já fez uma revisão sistemática conhece a parte que ninguém conta na metodologia: depois da triagem, sobram dezenas de PDFs e uma planilha vazia. Cada artigo precisa ser aberto, lido e transformado em uma linha com desenho do estudo, amostra, país, intervenção, desfecho e o que mais o protocolo exigir. Oitenta artigos, doze colunas, uma célula por vez.

O ferdy existe para esse trecho específico do trabalho. Ele não escreve a sua revisão nem decide o que entra nela — ele faz o primeiro passe de extração, aplicando a mesma instrução a todos os artigos e devolvendo uma tabela com um artigo por linha, pronta para você conferir e exportar.

O caminho, em três passos

1. Reunir os artigos

Há três entradas, e elas convivem no mesmo projeto:

  • Busca nas bases. Uma consulta é disparada ao mesmo tempo em sete bases abertas — OpenAlex, PubMed/Europe PMC, arXiv, DOAJ, ERIC, BDTD e Oasisbr — e os resultados chegam reunidos, sem duplicatas de DOI. Quem é de instituição assinante pode somar o Web of Science usando a própria chave da Clarivate.
  • Lista de identificadores. Se a seleção já está pronta em outro lugar (Excel, Rayyan, exportação de base), cole até 50 por vez: DOI, links doi.org, DOIs no meio de referências copiadas, PMID do PubMed ou id do arXiv. O ferdy busca a ficha de cada um e tenta o PDF sozinho.
  • Seus arquivos. Arrastar os PDFs que você já baixou continua sendo o caminho mais direto — e o único possível quando o artigo é de editora paga e você tem acesso pela biblioteca da universidade.

Nem todo artigo tem PDF disponível publicamente. Quando a fonte não entrega o arquivo, o artigo aparece marcado como PDF não obtido — sem cobrança — para você baixar pelo acesso da sua instituição e enviar.

2. Definir as colunas

Esta é a etapa que decide a qualidade de tudo o que vem depois. Você cria até 14 colunas, e cada uma carrega a sua própria instrução: não basta escrever “Amostra”, escreva “Número de participantes analisados; apenas o numeral; se houver perdas, use o n final”. Quanto mais específica a instrução, mais consistente a coluna.

Ao aprovar as colunas, o ferdy monta o roteiro que será aplicado a todos os artigos do projeto. É o mesmo princípio de um formulário de extração de dados em papel — só que aplicado por uma máquina que não se cansa na quadragésima leitura.

O que não estiver explícito no texto do artigo vira NA. Isso é intencional: é melhor uma lacuna visível do que um valor inventado.

3. Receber a tabela

Cada artigo processado vira uma linha. Você acompanha a fila em tempo real, abre o detalhe de qualquer linha para conferir o que foi extraído, corrige o que precisar e exporta em Excel, CSV ou PDF — com os rótulos que você escolheu, prontos para colar no material suplementar.

O que o ferdy não faz

Vale dizer com todas as letras, porque ferramenta de pesquisa que promete demais atrapalha:

  • Não substitui a leitura. A extração é um primeiro passe consistente, para ser conferido. Para revisão sistemática, mantenha a dupla checagem prevista no seu protocolo — a PRISMA 2020 pede que o uso de automação seja declarado.
  • Não faz a triagem por título e resumo com dois revisores independentes e cálculo de concordância — essa etapa continua sendo sua (ou do Rayyan, se você já usa).
  • Não faz meta-análise. Ele entrega a tabela; a síntese estatística é feita no seu software de sempre.
  • Não lê PDF escaneado. Arquivo sem camada de texto é recusado como ilegível — e, como toda falha, não consome créditos. Passe um OCR antes de enviar.
  • Não sugere o seu método. O ferdy não propõe critério de inclusão, não decide o que entra na revisão e não opina sobre desenho de estudo. Ele aplica, artigo por artigo, a instrução que você escreveu. O critério vem do seu protocolo e da sua orientação — é isso que dá validade ao trabalho.

Como a cobrança funciona

A conta é uma só: um crédito equivale a uma página de PDF processada com sucesso. Um artigo de doze páginas que vira linha consome doze créditos. Se o processamento falhar — arquivo ilegível, serviço indisponível, PDF não obtido —, nada é descontado. Você paga pelo que entrou na tabela, não pelas tentativas.

Os créditos são pré-pagos, sem assinatura mensal: quem faz uma revisão por ano não fica pagando pelos onze meses em que a ferramenta está parada.

E os seus PDFs?

Não ficam guardados. O arquivo é usado durante o processamento e apagado em seguida, com sucesso ou com falha. O que permanece no seu projeto são os dados extraídos — as linhas da tabela. Isso também vale para quem envia material sob acordo de confidencialidade com a biblioteca da instituição.

Para quem isso serve

Para quem está com a seleção fechada e a planilha por fazer: mestrandos e doutorandos na revisão do capítulo teórico, grupos de pesquisa tocando uma revisão sistemática a várias mãos, orientadores que precisam de extração padronizada entre orientandos — para esse último caso existe o modo Equipe, com projetos compartilhados e créditos distribuídos por cota.

Se a sua etapa ainda é a busca — decidir a string, escolher as bases, registrar o protocolo —, comece pelos textos de método aqui do blog. Se ela é a planilha, o caminho mais curto é criar um projeto e testar com cinco artigos que você conhece bem: dá para comparar o que a máquina extraiu com o que você extrairia, que é o único teste que importa.