See discussions, stats, and author profiles for this publication at: [Link]
net/publication/393802473
Modelo de classificação automática de publicações do OpenAlex com base nas
áreas do conhecimento do CNPq e da CAPES
Conference Paper · July 2025
CITATIONS READS
0 10
4 authors:
Fábio Lorensi do Canto Patricia Da Silva Neubert
Universidade Federal de Santa Catarina Universidade Federal de Santa Catarina
35 PUBLICATIONS 48 CITATIONS 42 PUBLICATIONS 76 CITATIONS
SEE PROFILE SEE PROFILE
Washington Ribeiro de Carvalho-Segundo Thiago Dias
Instituto Brasileiro de Informação em Ciência e Tecnologia Federal Center for Technological Education of Minas Gerais
184 PUBLICATIONS 174 CITATIONS 194 PUBLICATIONS 339 CITATIONS
SEE PROFILE SEE PROFILE
All content following this page was uploaded by Washington Ribeiro de Carvalho-Segundo on 19 July 2025.
The user has requested enhancement of the downloaded file.
CANELA, RS 2025
Modelo de Classificação Automática de Publicações do OpenAlex com
Base nas Áreas do Conhecimento do CNPq e da CAPES
Automatic Classification Model of OpenAlex Publications Based on CNPq and CAPES Classification Systems
Fabio Canto (1), Patricia Neubert (2), Washington Carvalho Segundo (3), Thiago Dias (4)
(1) Instituto Brasileiro de Informação em Ciência e Tecnologia, fabiocanto@[Link], ORCID: 0000-0002-8338-1931.
(2) Universidade Federal de Santa Catarina, patrí[Link]@[Link], ORCID: 0000-0002-8909-1898. (3) Instituto
Brasileiro de Informação em Ciência e Tecnologia, washingtonsegundo@[Link], ORCID: 0000-0003-3635-9384. (4)
Instituto Brasileiro de Informação em Ciência e Tecnologia, thiagomagela@[Link], ORCID: 0000-0001-5057-
9936.
DOI: 10.22477/ISKO25.92
Resumo
Objetivo: Desenvolver um modelo de classificação automática de publicações indexadas no OpenAlex com base nos sistemas de
classificação de áreas do conhecimento do CNPq e da CAPES, com o objetivo de facilitar a organização e a análise da produção
científica nacional a partir dessa fonte aberta de dados e informações sobre pesquisa. Metodologia: Para a construção do modelo de
compatibilização entre os sistemas foi adotada uma abordagem que combinou processos automatizados de mapeamento e
correspondência entre áreas e conceitos, complementados por uma etapa de classificação e validação conduzidas por dois bibliotecários.
Foram aplicadas técnicas de processamento de linguagem natural e análise de dados para a classificação das publicações. Para aplicação
do modelo de classificação automática foi desenvolvido um programa em linguagem Python, hospedado em repositório no GitHub e
disponível em uma aplicação on-line. Resultados: Foi desenvolvido um modelo de compatibilização que mantém a estrutura e a
hierarquia dos sistemas de classificação do CNPq e da CAPES, associando conceitos do OpenAlex a cada categoria dos sistemas
nacionais. Também foi criado um sistema on-line que recebe do usuário uma URL da API do OpenAlex, classifica automaticamente
as publicações conforme as categorias do CNPq e da CAPES, e gera redes de coocorrência entre as áreas, possibilitando a extração dos
resultados. Conclusão: A compatibilização entre diferentes classificações de áreas do conhecimento pode contribuir para a melhoria
da organização e avaliação da informação científica brasileira, ao viabilizar a integração com padrões adotados por bases internacionais
de informação científica. A adoção de um sistema compatível com bases abertas também fortalece a Ciência Aberta, promovendo
maior transparência e reduzindo a dependência de modelos comerciais para a avaliação da produção científica.
Palavras-chave: Sistemas de classificação. Bases de dados científicas. Conceitos do OpenAlex.
Abstract
Objective: To develop an automatic classification model for publications indexed in OpenAlex based on the subject area classification
systems of CNPq and CAPES, with the aim of facilitating the organization and analysis of Brazilian scientific output using this open
data source on research and scholarly information. Methodology: To build the alignment model between the classification systems, an
approach was adopted that combined automated mapping and matching processes between subject areas and concepts, complemented
by a classification and validation stage conducted by two professional librarians. Natural language processing and data analysis
techniques were applied to classify the publications. For the application of the automatic classification model, a program was developed
in Python, hosted in a GitHub repository and made available through an online platform. Results: A compatibility model was developed
that preserves the structure and hierarchy of the CNPq and CAPES classification systems, associating OpenAlex concepts with each
category of the national systems. Additionally, an online system was created that receives a URL from the OpenAlex API provided by
the user, automatically classifies the corresponding publications based on the CNPq and CAPES categories, and generates co-
occurrence networks of the subject areas, enabling results to be extracted. Conclusion: Aligning different subject classification systems
can enhance the organization and evaluation of Brazilian scientific information by enabling integration with standards adopted by
international scientific information databases. The adoption of a system compatible with open data sources also strengthens Open
Science, promoting greater transparency and reducing dependence on commercial models for the evaluation of scientific output.
Keywords: Classification systems. Scientific databases. OpenAlex concepts.
Resumen
Objetivo: Desarrollar un modelo de clasificación automática de publicaciones indexadas en OpenAlex, basado en los sistemas de
clasificación por áreas del conocimiento del CNPq y de la CAPES, con el objetivo de facilitar la organización y el análisis de la
producción científica nacional a partir de esta fuente abierta de datos e información sobre la investigación. Metodología: Para la
construcción del modelo de compatibilización entre los sistemas de clasificación, se adoptó un enfoque que combinó procesos
automatizados de mapeo y correspondencia entre áreas y conceptos, complementados por una etapa de clasificación y validación
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
llevada a cabo por dos bibliotecarios. Se aplicaron técnicas de procesamiento de lenguaje natural y análisis de datos para la clasificación
de las publicaciones. Para la aplicación del modelo de clasificación automática, se desarrolló un programa en lenguaje Python, alojado
en un repositorio en GitHub y disponible a través de una plataforma en línea. Resultados: Se desarrolló un modelo de compatibilización
que mantiene la estructura y jerarquía de los sistemas de clasificación del CNPq y de la CAPES, asociando conceptos de OpenAlex a
cada categoría de los sistemas nacionales. Además, se creó un sistema en línea que recibe una URL de la API de OpenAlex
proporcionada por el usuario, clasifica automáticamente las publicaciones de acuerdo con las categorías del CNPq y de la CAPES, y
genera redes de coocurrencia entre las áreas, permitiendo la extracción de los resultados. Conclusión: La compatibilización entre
diferentes sistemas de clasificación por áreas del conocimiento puede contribuir a mejorar la organización y evaluación de la
información científica brasileña, al permitir la integración con estándares adoptados por bases internacionales de información científica.
La adopción de un sistema compatible con fuentes de datos abiertas también fortalece la Ciencia Abierta, promoviendo mayor
transparencia y reduciendo la dependencia de modelos comerciales para la evaluación de la producción científica.
Palabras clave: Sistemas de clasificación. Bases de datos científicas. Conceptos de OpenAlex.
1 Introdução
A análise da produção científica a partir de dados extraídos de múltiplas fontes pode exigir o uso de metodologias de
compatibilização entre os diferentes sistemas de classificação de áreas do conhecimento e categorias de assuntos
utilizados em cada fonte (Aviv-Reuven; Rosenfeld, 2022; Kurakawa; Sun; Ando, 2020). Essa necessidade decorre dos
distintos modelos de classificação adotados por instituições, bases de dados e repositórios, que podem variar quanto ao
número de níveis hierárquicos, à nomenclatura empregada, à segmentação ou agrupamento de classes e às regras de
categorização. Além disso, a crescente interdisciplinaridade da ciência e a velocidade com que novas áreas e disciplinas
surgem impõem desafios adicionais aos modelos de compatibilização entre sistemas de classificação (Glänzel; Schubert,
2003; Souza, 2006).
Esses desafios são evidenciados na tentativa de compatibilizar sistemas de classificação utilizados em bases de dados
internacionais com os sistemas adotados no Brasil. Bases de dados como a Web of Science (WoS) e a Scopus são
amplamente utilizadas na recuperação da informação, na avaliação da produção científica e em estudos bibliométricos
(Aviv-Reuven; Rosenfeld, 2022; Wang; Waltman, 2016). Os indicadores extraídos dessas fontes são adotados por
agências de fomento para mensurar a produtividade, a visibilidade e o impacto da produção científica (Wang; Waltman,
2016).
Nos últimos anos, o OpenAlex vem ganhando destaque como fonte de dados e informações sobre a produção científica.
Apresenta-se como uma alternativa às tradicionais plataformas comerciais, oferecendo vantagens como maior cobertura,
acesso gratuito e abertura total dos dados (Priem; Piwowar; Orr, 2022). O OpenAlex utiliza a classificação por conceitos
da Wikidata, modelo aberto baseado em web semântica e linked data, mantido pelo projeto Wikimedia (Vrandečić;
Krötzsch, 2014). Compreender a estrutura e o funcionamento desse modelo de organização do conhecimento pode
incentivar sua utilização em processos de avaliação da ciência no Brasil, reduzindo a dependência de plataformas
comerciais e favorecendo a Ciência Aberta (Neubert et al., 2024).
No contexto nacional, as duas principais agências de fomento à pesquisa — a Coordenação de Aperfeiçoamento de
Pessoal de Nível Superior (CAPES) e o Conselho Nacional de Desenvolvimento Científico e Tecnológico (CNPq) —
adotam sistemas de classificação de áreas do conhecimento bastante semelhantes, embora não idênticos. Ambas as
classificações são amplamente empregadas na organização e na avaliação da ciência nacional. O sistema da CAPES é
utilizado principalmente na avaliação de programas de pós-graduação e da produção científica associada, enquanto o
sistema do CNPq tem como foco a avaliação de projetos de pesquisa e pesquisadores, sendo empregado em processos de
concessão de bolsas e financiamento de pesquisas (Oliveira et al., 2013; Souza, 2006).
Este trabalho propõe um modelo de classificação automática de publicações indexadas no OpenAlex com base nos
sistemas de classificação de áreas do conhecimento do CNPq e da CAPES. O objetivo é criar um modelo que permita a
integração entre esses sistemas, facilitando a organização e a análise da produção científica nacional a partir de uma fonte
aberta de dados e informações sobre a pesquisa global.
O estudo é orientado pelos seguintes problemas de pesquisa: como compatibilizar o modelo de classificação por conceitos
da Wikidata, utilizado no OpenAlex, com os sistemas de classificação do CNPq e da CAPES? Como classificar
automaticamente as publicações indexadas no OpenAlex com base nos sistemas de classificação de áreas do CNPq e da
CAPES? A fim de responder essas questões, o estudo adota uma metodologia que combina processos automatizados de
mapeamento e correspondência entre categorias, complementados por processos de classificação intelectual e de
validação conduzida por dois bibliotecários especializados. A partir do modelo, é desenvolvida ainda uma ferramenta
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
online que classifica automaticamente publicações indexadas no OpenAlex com base nos sistemas de classificação do
CNPq e da CAPES.
2 Sistemas de classificação de áreas do conhecimento
As tabelas de classificação de áreas do conhecimento do CNPq e da CAPES servem de referência para as atividades de
pesquisa sob responsabilidade dessas duas instituições, consideradas as mais relevantes na formulação de políticas, no
fomento e na avaliação da ciência, tecnologia e inovação no Brasil (Prado; Sayd, 2007). Embora compartilhem uma
estrutura hierárquica semelhante, suas finalidades são distintas. A classificação do CNPq é utilizada na Plataforma Lattes,
no Diretório de Grupos de Pesquisa (DGP) e na submissão de projetos de pesquisa em editais de bolsas e financiamentos.
Já a classificação da CAPES é aplicada na avaliação de programas de pós-graduação, abrangendo a produção acadêmica,
científica, técnica e artística dos pesquisadores.
Ambas as classificações contam com quatro níveis hierárquicos: grande área, área do conhecimento, subárea e
especialidade. A grande área é definida como o agrupamento de diferentes áreas do conhecimento que compartilham
semelhanças em seus objetos de estudo, métodos de investigação e ferramentas utilizadas. A área do conhecimento
corresponde a um conjunto de saberes interligados, desenvolvidos coletivamente e organizados conforme a natureza do
objeto investigado, com objetivos voltados ao ensino, à pesquisa e à aplicação prática. A subárea representa uma divisão
dentro de uma área do conhecimento, definida com base no foco do estudo e em metodologias amplamente reconhecidas.
Por fim, a especialidade refere-se a um recorte temático mais específico das atividades de pesquisa e ensino, podendo ser
associada a diferentes áreas (CAPES, 2020; Oliveira et al., 2013).
A classificação da CAPES contempla nove grandes áreas: Ciências Exatas e da Terra, Ciências Biológicas, Engenharias,
Ciências da Saúde, Ciências Agrárias, Ciências Sociais Aplicadas, Ciências Humanas, Linguística, Letras e Artes, além
de uma categoria adicional denominada Multidisciplinar. A árvore de áreas do conhecimento do CNPq, por sua vez,
apresenta as mesmas grandes áreas, com exceção da categoria Multidisciplinar (Prado; Sayd, 2007).
2.1 Sistemas de classificação de bases de dados
A classificação de áreas do conhecimento ou categorias de assuntos em bases de dados científicas é uma forma de
representação externa do conteúdo geral das publicações indexadas e das relações estabelecidas entre elas (Zhang; Liu;
Wu, 2016). Os esquemas de classificação servem como base para diversos aspectos da estruturação e do funcionamento
dessas bases, como a organização do conteúdo, o acesso e a recuperação da informação, a análise bibliométrica e a
visualização de dados (Gómez-Núñez et al., 2011).
Tradicionalmente, a classificação de documentos é realizada por profissionais especializados, que analisam tecnicamente
o conteúdo dos documentos e definem a categoria mais adequada a partir de um sistema de classificação. A chamada
classificação intelectual ou por humanos é considerada mais precisa, pois leva em conta questões semânticas, contexto
disciplinar e outros aspectos que podem não ser detectados por métodos automatizados. No entanto, esse processo é mais
demorado e exige maior volume de recursos humanos e materiais (Wang; Waltman, 2016; Suominen; Toivanen, 2016).
Bases de dados de ampla cobertura costumam utilizar classificações automatizadas, com modelos baseados em
aprendizado de máquina e processamento de linguagem natural para realizar a categorização em larga escala, reduzindo
o tempo e os custos do processo (Suominen; Toivanen, 2016; Glänzel; Schubert, 2003). Uma abordagem tradicional é a
classificação em nível da fonte, ou seja, a categorização de publicações com base na fonte — como periódicos e anais de
eventos —, associando todos os documentos publicados à mesma classificação. Embora essa estratégia facilite a
categorização em grande escala, pode dificultar a representação adequada de fontes com perfil multidisciplinar (Waltman;
Van Eck, 2012).
A Web of Science (WoS) e a Scopus adotam sistemas de classificação em nível da fonte. Um mesmo periódico pode ser
classificado em mais de uma categoria. A WoS possui 254 categorias de assunto, agrupadas em três coleções: Ciências
(geral), Ciências Sociais e Artes e Humanidades. Já o All Science Journal Classification (ASJC), desenvolvido pela
Elsevier para a Scopus, é mais amplo e estruturado em dois níveis: 27 áreas principais e 334 categorias de assunto ou
subáreas (Martín-Martín et al., 2018; Singh et al., 2020).
Na classificação em nível de artigo ou publicação, o processo é inverso: cada artigo é analisado individualmente, e a
classificação da fonte é derivada da análise da proporção de artigos em cada área. Define-se como área principal aquela
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
com maior número de artigos classificados. Quando há uma distribuição equilibrada entre diferentes áreas, a fonte pode
ser associada a categorias especiais ou multidisciplinares (Waltman; Van Eck, 2012; Singh et al., 2020). As bases de
dados Dimensions e OpenAlex utilizam modelos baseados na classificação em nível de artigo (Singh et al., 2020; Priem;
Piwowar; Orr, 2022).
A classificação em nível de artigo também pode ser baseada em análise de redes de citação. Nessa abordagem, cada artigo
é representado como um nó em uma rede conectada por citações. Por meio de algoritmos e métricas de rede, é possível
identificar clusters ou grupos de artigos com padrões de citação semelhantes, que podem ser atribuídos a uma mesma
categoria temática (Van Eck; Waltman, 2024).
2.2 Os conceitos da Wikidata
O Wikidata é uma plataforma colaborativa que armazena dados estruturados no contexto do projeto Wikimedia. Permite
a centralização, edição aberta e reutilização livre desses dados em outras plataformas. Sua estrutura é baseada em
princípios da web semântica e de linked data, em que cada objeto possui um identificador único e está associado a
propriedades e declarações que descrevem suas características (Vrandečić; Krötzsch, 2014).
A organização do Wikidata gira em torno de entidades chamadas itens, que representam conceitos, objetos, pessoas,
eventos ou qualquer elemento passível de descrição. Cada item possui um identificador persistente e é descrito por um
rótulo, uma breve descrição e uma lista de termos associados. Esses itens são conectados por propriedades, que funcionam
como relações entre elementos e definem seus atributos e características. As propriedades também têm identificadores
persistente e podem representar informações qualitativas ou quantitativas. Os dados da Wikidata podem ser acessados
por meio de RESP API ou interface de consulta SPARQL.
2.2 Os conceitos do OpenAlex
O OpenAlex é um repositório aberto e abrangente de dados e informações sobre a produção científica global. Foi
desenvolvido com base nos dados da Microsoft Academic Graph (MAG) (Sinha et al., 2015), após o encerramento desse
projeto em 2021 (Priem; Piwowar; Orr, 2022). Além da estrutura em grafo de entidades acadêmicas criada pelo MAG —
como autores, publicações, fontes, instituições, entre outras —, o OpenAlex manteve o modelo de classificação baseado
em conceitos acadêmicos da Wikidata, com algumas modificações.
Os conceitos representam o conteúdo temático das publicações indexadas no OpenAlex. São aproximadamente 65 mil
conceitos, organizados em campos que incluem nomes em diversos idiomas, identificadores persistentes, descrições e
outros metadados. A estrutura conceitual é hierárquica, organizada em formato de árvore, na qual os conceitos se inter-
relacionam por meio das propriedades "ancestors" (ancestrais) e "related_concepts" (conceitos relacionados). Todo o
conjunto de dados relativos aos conceitos pode ser acessado por meio da API do OpenAlex. Também é disponibilizada
uma tabela com os conceitos, embora contenha apenas os campos principais.
Atualmente, existem 19 conceitos de nível raiz (nível zero), a partir dos quais se ramificam até seis níveis descendentes.
Cerca de 85% das publicações indexadas no OpenAlex possuem pelo menos um conceito associado. Essa atribuição é
realizada automaticamente, com base nas informações do título, do resumo e do título da fonte (periódico ou evento) em
que a publicação foi divulgada. A cada conceito atribuído é associado um score, que expressa o grau de confiança do
sistema quanto à relevância daquele conceito para a publicação (Priem; Piwowar; Orr, 2022).
Além disso, sempre que um conceito de nível inferior é atribuído, todos os seus conceitos ascendentes, até a raiz, também
são automaticamente incluídos. Embora o sistema permita a classificação de publicações em diferentes idiomas, seu
desempenho é superior em publicações redigidas em inglês. Embora o modelo esteja em processo de substituição no
OpenAlex, a classificação por conceitos da Wikidata ainda é mantida para aproximadamente 200 milhões de publicações,
incluindo cerca de 3 milhões de publicações de autoria brasileira.
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
3 Procedimentos metodológicos
3.1 Construção do Modelo
Foi elaborada uma tabela de equivalência entre os sistemas de classificação do CNPq e da CAPES, mapeando as
categorias idênticas ou equivalentes e seus respectivos identificadores numéricos. Em seguida, os nomes das categorias
nos quatro níveis da tabela do CNPq foram traduzidos para o inglês por meio da ferramenta de tradução automática
DeepL. Foi desenvolvido um script para identificação de similaridade textual, com o objetivo de realizar a
correspondência automatizada entre as categorias do CNPq (em inglês) e a lista de conceitos do OpenAlex.
As categorias que não foram identificadas automaticamente foram analisadas por dois bibliotecários especializados, que
realizaram a classificação intelectual, selecionando o(s) conceito(s) do OpenAlex com significado mais próximo. Para
categorias sem correspondentes diretos, foi atribuído o conceito hierarquicamente superior, de modo a garantir que todas
as categorias possuíssem pelo menos um conceito associado. Esse processo pode ser comparado à classificação de
documentos com base em sistemas como a CDU ou a CDD. No entanto, neste caso, o objeto de classificação foram as
categorias das tabelas do CNPq e da CAPES, que foram associadas ao modelo conceitual do OpenAlex.
Por fim, foi realizada uma revisão final da tabela de equivalência, com o objetivo de aprimorar a consistência e a precisão
da correspondência entre os sistemas. A versão final da tabela foi convertida para o formato JSON, preservando a
hierarquia em quatro níveis dos sistemas de classificação do CNPq e da CAPES. Além dos conceitos, foram incorporados
ao modelo os identificadores persistentes do Wikidata e do OpenAlex, bem como o nível hierárquico na estrutura do
OpenAlex.
3.2 Aplicação do modelo
Para a aplicação do modelo, foi desenvolvido um programa em linguagem Python, capaz de processar dados provenientes
do OpenAlex e classificar publicações de acordo com os sistemas de classificação do CNPq e da CAPES. O sistema opera
por meio de uma interface web construída com a biblioteca Streamlit e recebe, como entrada, uma URL da API do
OpenAlex correspondente ao conjunto de publicações a ser classificado. O usuário pode selecionar qual sistema de
classificação será utilizado — CNPq ou CAPES.
Após o comando do usuário, o sistema realiza a extração dos dados da API e executa a classificação com base no modelo
de compatibilização desenvolvido. Nos casos em que uma publicação é associada a mais de uma área, o sistema calcula
uma pontuação (score) com base na quantidade de conceitos vinculados a cada área, a fim de atribuir uma classificação
prioritária. Além da classificação, foram inseridas duas ferramentas de visualização de redes de coocorrência entre áreas
nos quatro níveis de classificação, sendo uma versão estática e outra dinâmica. Todos os resultados podem ser exportados
nos formatos CSV e de grafos (.graphml e .gexf).
4 Resultados
4.1 Estrutura do modelo
Foi desenvolvido um modelo de dados em formato JSON para compatibilizar os conceitos do OpenAlex com as
classificações do CNPq e da CAPES. O modelo foi estruturado com base no esquema das tabelas dessas instituições,
preservando a hierarquia das classes em quatro níveis: grande área, área, subárea e especialidade. Para cada categoria nos
quatro níveis, foram associados um ou mais conceitos, de modo que não restassem categorias sem pelo menos um conceito
vinculado.
O método de classificação automática foi responsável por aproximadamente 60% das associações, sendo o restante
realizado por meio de classificação intelectual. Na fase de validação, o total de divergências foi inferior a 5% do total de
associações realizadas nos dois processos. Os dados dos conceitos foram organizados como arrays (listas) no formato
JSON, conferindo maior flexibilidade ao modelo. A Figura 1 apresenta a estrutura em JSON da grande área (broad area)
e da área do conhecimento (research area), respectivamente para Engenharias e Engenharia Civil.
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
Figura 1. Estrutura de grande área e de área do modelo de compatibilização
Os campos definidos no modelo foram: "category", que indica o nível hierárquico; "cnpq_label", correspondente à
denominação utilizada na tabela do CNPq; "cnpq_label_eng", que apresenta a tradução do nome para o inglês; e
"cnpq_id", que indica o número de registro da entrada na tabela do CNPq. Para os dados da CAPES, foram utilizados os
campos "capes_label" e "capes_id", que correspondem, respectivamente, ao nome e ao número de registro da entrada no
sistema de classificação da CAPES.
Os dados do campo "concepts", referentes aos conceitos associados, são organizados em listas (arrays), incluindo os
nomes dos conceitos, seus identificadores persistentes na Wikidata e no OpenAlex, além do nível hierárquico
correspondente. A Figura 2 apresenta a estrutura do modelo de compatibilização nos níveis de subárea (subarea) e
especialidade (subject).
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
Figura 2. Estrutura de subárea e de especialidade do modelo de compatibilização
4.2 Aplicação do modelo
A Figura 3 apresenta a interface do sistema de classificação automática de publicações extraídas da OpenAlex, com base
no modelo de compatibilização de dados proposto. O sistema está disponível online ([Link]
[Link]/) e pode ser acessado por meio de um navegador web. O usuário informa a URL da
API das publicações do OpenAlex, e seleciona o sistema de classificação desejado (CNPq ou CAPES). O modelo de
compatibilização de dados é carregado automaticamente. A partir do comando do usuário, o sistema extrai os dados da
API do OpenAlex e realiza a classificação com base no modelo proposto.
Figura 3. Interface do sistema de classificação automática
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
Como resultado, é gerada uma tabela contendo o identificador da publicação, os conceitos associados no OpenAlex e as
respectivas áreas do CNPq ou da CAPES. Em caso de classificação em mais de uma categoria em qualquer dos quatro
níveis, é atribuído um score proporcional à frequência de ocorrência de cada categoria. A Figura 4 apresenta um exemplo
da estrutura dos dados de saída gerados pelo sistema, sendo possível a exportação em formato .CSV.
Figura 4. Apresentação dos resultados do sistema
O sistema também permite a criação de um grafo para representar a rede a partir dos dados de classificação. O usuário
seleciona o nível hierárquico desejado e aciona a opção de geração da rede. A Figura 5 mostra o exemplo de grafo gerado
pelo sistema a partir dos resultados da classificação em nível de área do conhecimento do sistema do CNPq.
Figura 5. Rede de coocorrência de áreas do sistema
A rede pode ser exportada em formatos compatíveis com ferramentas de visualização de grafos (.graphml e .gexf),
compatíveis com softwares como Gephi, VOSviewer e Netdraw.
3 Conclusão
O modelo pode contribuir para a melhoria da organização e da avaliação da informação científica brasileira, promovendo
a integração com padrões internacionais. A adoção de um sistema compatível com bases abertas, como o OpenAlex,
fortalece a Ciência Aberta, ampliando a transparência e reduzindo a dependência de modelos comerciais na avaliação da
produção científica.
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
Além das aplicações em processos oficiais de avaliação por agências de fomento, o modelo pode ser utilizado em
pesquisas bibliométricas e em análises de dados baseadas em múltiplas fontes. Também pode servir como base para a
construção de novos modelos de compatibilização de dados.
Correspondente à primeira fase da pesquisa, este trabalho concentrou-se na descrição da construção do modelo e do
sistema de classificação automática. Como consequência, o estudo apresenta algumas limitações, como o número ainda
reduzido de conceitos associados no modelo, em comparação ao total disponível no OpenAlex. Pretende-se ampliar essa
associação por meio do uso de ferramentas de inteligência artificial generativa.
Além disso, não foram realizadas análises de precisão do sistema de classificação. Eventuais inconsistências na
classificação por conceitos do OpenAlex também podem ser replicadas no modelo proposto. Para a avaliação da precisão
do modelo, é necessário dispor de um conjunto de publicações indexadas no OpenAlex previamente classificadas segundo
os sistemas do CNPq e/ou da CAPES. Essas atividades estão previstas para a segunda fase da pesquisa.
Referências
AVIV-REUVEN, S.; ROSENFELD, A. A logical set theory approach to journal subject classification analysis: intra-system
irregularities and inter-system discrepancies in Web of Science and Scopus. Department of Information Sciences, Bar-Ilan
University, Israel, 7 set. 2022. Disponível em: [Link] Acesso em: 20 fev. 2025.
COORDENAÇÃO DE APERFEIÇOAMENTO DE PESSOAL DE NÍVEL SUPERIOR (CAPES). Tabela de Áreas do
Conhecimento/Avaliação. Atualizado em: 01 jan. 2020. Disponível em: [Link]
e-programas/avaliacao/instrumentos/documentos-de-apoio/tabela-de-areas-de-conhecimento-avaliacao. Acesso em: 20 fev. 2025.
GLÄNZEL, W.; SCHUBERT, A. A new classification scheme of science fields and subfields designed for scientometric evaluation
purposes. Scientometrics, Dordrecht, v. 56, n. 3, p. 357–367, 2003. Disponível em: [Link]
Acesso em: 18 mar. 2025.
GÓMEZ-NÚÑEZ, A. J. et al. Improving SCImago Journal & Country Rank (SJR) subject classification through reference analysis.
Scientometrics, v. 89, p. 741–758, 2011. Disponível em: [Link]
Acesso em: 18 mar. 2025.
KURAKAWA, K.; SUN, Y.; ANDO, S. Application of a novel subject classification scheme for a bibliographic database using a
data-driven correspondence. Frontiers in Big Data, v. 2, p. 48, 2020. Disponível em: [Link]
Acesso em: 12 mar. 2025.
MARTÍN-MARTÍN, A. et al. Google Scholar, Web of Science, and Scopus: A systematic comparison of citations in 252 subject
categories. Journal of Informetrics, v. 12, n. 4, p. 1160-1177, 2018. Disponível em:
[Link] Acesso em: 2 mar. 2025.
NEUBERT, P. et al. OpenAlex como fonte de dados para sistemas nacionais de informação científica: a experiência do projeto
Laguna. In: WORKSHOP DE INFORMAÇÃO, DADOS E TECNOLOGIA, 7., 2024, Porto Velho. Anais [...] Porto Velho, 2024.
Disponível em: [Link] Acesso em: 27 mar. 2025.
OLIVEIRA, D. C. de et al. Classificação das áreas de conhecimento do CNPq e o campo da Enfermagem: possibilidades e limites.
Revista Brasileira de Enfermagem, v. 66, n. spe, p. 60–65, set. 2013. Disponível em: [Link]
71672013000700008. Acesso em: 22 mar. 2025.
PRADO, S. D.; SAYD, J. D. Como poderia a Gerontologia, um campo multidisciplinar do saber, estar presente na Tabela das Áreas
do Conhecimento do CNPq?. Ciência & Saúde Coletiva, v. 12, n. 6, p. 1725–1735, nov. 2007. Disponível em:
[Link] Acesso em: 02 mar. 2025.
PRIEM, J.; PIWOWAR, H.; ORR, R. OpenAlex: a fully-open index of scholarly works, authors, venues, institutions, and concepts.
ArXiv, 2022. Disponível em: [Link] Acesso em: 10 mar. 2024.
SINGH, P. et al. Revisiting subject classification in academic databases: a comparison of the classification accuracy of Web of
Science, Scopus & Dimensions. Journal of Intelligent & Fuzzy Systems, v. 38, n. 3, p. 2471–2476, 2020. Disponível em:
[Link] Acesso em: 12 mar. 2025.
SINHA, A. et al. An overview of Microsoft Academic Service (MAS) and applications. In: INTERNATIONAL CONFERENCE ON
WORLD WIDE WEB COMPANION, 24., Florence, 2015. Proceedings […] New York: ACM, 2015. p. 243–246. Disponível em:
10.1145/2740908.2742839. Acesso em: 12 mar. 2025.
SOUZA, R. F. Organização e representação de áreas do conhecimento em ciência e tecnologia: princípios de agregação em grandes
áreas segundo diferentes contextos de produção e uso de informação. Encontros Bibli: revista eletrônica de biblioteconomia e
ciência da informação, v. 11, n. 1, p. 27–41, 2006. Disponível em: [Link] Disponível
em: [Link] Acesso em: 02 mar. 2025.
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
CANELA, RS 2025
SUOMINEN, A; TOIVANEN, H. (Map of science with topic modeling: Comparison of unsupervised learning and human-assigned
subject classification. Journal of the Association for Information Science and Technology, v. 67, p. 2464-2476, 2016.
[Link] Acesso em: 12 mar. 2025.
VAN ECK, N. J.; WALTMAN, L. An open approach for classifying research publications. Leiden Madtrics, 24 jan. 2024.
Disponível em: [Link] Acesso em: 12 mar.
2025.
VRANDEČIĆ, D.; KRÖTZSCH, M. Wikidata: a free collaborative knowledgebase. Communications of the ACM, v. 57, n. 10, p.
78-85, 2014. Disponível em: [Link] Acesso em: 20 fev. 2025.
WALTMAN, L.; VAN ECK, N. J. A new methodology for constructing a publication-level classification system of science. Journal
of the American Society for Information Science and Technology, v. 63, n. 12, p. 2378-2392, 2012. Disponível em:
[Link] em: 20 fev. 2025.
WANG, Q.; WALTMAN, L. Large-scale analysis of the accuracy of the journal classification systems of Web of Science and
Scopus. Journal of Informetrics, v. 10, n. 2, p. 347–364, 2016. Disponível em:
[Link] Acesso em: 25 fev. 2025.
ZHANG, J.; LIU, X.; WU, L. The study of subject-classification based on journal coupling and expert subject-classification system.
Scientometrics, v. 107, p. 1149–1170, 2016. Disponível em: [Link]
9. Acesso em: 20 fev. 2025.
Canto, Fabio; Neubert, Patricia; Carvalho Segundo, Washington; Dias, Thiago. ISKO Brasil, Canela, RS, 2025.
View publication stats