O Instituto de Lexicologia e Lexicografia da Língua Portuguesa (ILLLP) da Academia das Ciências de Lisboa está a reforçar a presença da língua portuguesa nas grandes infraestruturas internacionais de dados linguísticos.
No âmbito de um trabalho desenvolvido em colaboração com a Universidade do País Basco (EHU), cerca de 70 000 entradas do Dicionário da Língua Portuguesa (DLP) foram integradas nos Lexemas da Wikidata, a área da Wikidata dedicada à representação estruturada de palavras, formas e sentidos. Os dados podem também ser explorados na ILLLP Wikibase, a plataforma onde são estruturados, relacionados e progressivamente enriquecidos.
Este trabalho permite que os dados do DLP possam ser pesquisados, relacionados com outros recursos e reutilizados em diferentes ambientes digitais, mantendo sempre a ligação ao registo original do dicionário.
Para tornar esta integração possível, dados do DLP foram convertidos para formatos internacionais de representação de informação lexicográfica e organizados na Wikibase do ILLLP. O processo não corresponde, porém, a uma simples transferência automática de dados.
Foi necessária uma importante componente de validação editorial, nomeadamente para verificar a correspondência entre os sentidos descritos no DLP e os conceitos representados na Wikidata. Estas decisões exigem trabalho lexicográfico especializado, uma vez que as distinções estabelecidas num dicionário têm de ser adequadamente representadas num novo ambiente de dados.
Português entre as dez línguas com mais lexemas na Wikidata
O impacto deste trabalho é já visível na representação internacional da língua portuguesa.
Segundo os dados disponibilizados pelo Ordia, ferramenta de exploração dos dados lexicográficos da Wikidata, o português encontra-se atualmente entre as dez línguas com maior número de lexemas registados na plataforma.
Esta presença crescente contribui para tornar os dados lexicais do português mais acessíveis e reutilizáveis por investigadores, projetos de Humanidades Digitais, aplicações de processamento de linguagem e sistemas de inteligência artificial.
A próxima etapa prevê o enriquecimento progressivo dos lexemas portugueses com nova informação, incluindo formas flexionadas, etimologias, exemplos de uso em corpus, pronúncias e ligações entre sentidos e conceitos.
Ao mesmo tempo, a exploração destes dados permite identificar inconsistências ou informação em falta no próprio dicionário. A reutilização dos dados cria, assim, um caminho de retorno: ajuda também os lexicógrafos da Academia a rever e melhorar o DLP.
O projeto constitui, deste modo, mais um passo na transformação do dicionário digital numa verdadeira infraestrutura de conhecimento sobre a língua portuguesa, capaz de ser consultada por pessoas, explorada por investigadores e reutilizada por sistemas computacionais.