Authorship attribution using co-occurrence networks

dc.contributor.advisorFerreira, Lígia Maria
dc.contributor.authorPires, David Laranjo
dc.date.accessioned2022-01-25T18:45:16Z
dc.date.available2022-01-25T18:45:16Z
dc.date.issued2021-11-02
dc.description.abstractAtribuição de Autoria utlizando Redes de Co-Ocorrencia Nesta tese é abordada a tarefa de Atribuição de Autoria como uma tarefa de classificação. As metodologias utilizadas representam textos em grafos. Destes, várias medidas são extraídas, sendo utilizadas como amostras para o classificador. Já existem alguns trabalhos que também se focam nesta metodologia. Esta tese foca-se num método que divide o texto em várias partes e trata cada uma como um grafo. Deste, são extraídas as medidas, que são tratadas como uma série temporal, da qual são extraídos momentos. Assim, os momentos compõem o vetor final, representativo de todo o texto. A partir da metodologia aqui descrita surgem mais duas variações. A primeira variação omite o passo das séries temporais, e, por consequência, as várias medidas de cada grafo são utilizadas diretamente como amostras. A segunda variação representa todo o texto como um só grafo. As metodologias são testadas com corpus em Inglês e Português, com número variado de textos; Abstract: Authorship Attribution using Co-Occurrence Networks This thesis approaches the task of Authorship Attribution as a classification task. This is done using methodologies that represent text documents in graphs, from which several measures are extracted, to be used as samples for the classifier. There have been some works that also focus on this methodology. This thesis focuses on a methodology which splits the texts in multiple parts and treats each as a separate graph, from which measures are extracted. Each graph’s measures are treated as a time-series and moments are extracted. These moments make the final vector, representative of the entire text. This methodology is explored and extended with 2 variations. The first variation skips the time-series step, resulting in the various measures from each graph being used directly as samples. The second variation models the entire text as one graph. The methodologies are tested in corpus in both English and Portuguese, with varying number of texts.por
dc.identifier.authoremailfaladouro@hotmail.com
dc.identifier.scientificarea498por
dc.identifier.sharewithDepartamento de Engenharia Informáticapor
dc.identifier.tid202898156por
dc.identifier.urihttp://hdl.handle.net/10174/30831
dc.language.isoengpor
dc.publisherUniversidade de Évorapor
dc.rightsopenAccesspor
dc.subjectAtribuição de Autoriapor
dc.subjectProcessamento de Lingua Naturalpor
dc.subjectGrafospor
dc.subjectRedes de co-ocorrenciapor
dc.subjectClassificaçãopor
dc.subjectAuthorship Attributionpor
dc.subjectNatural Language Processingpor
dc.subjectGraphspor
dc.subjectCo-Occurrence Networkspor
dc.subjectClassificationpor
dc.titleAuthorship attribution using co-occurrence networkspor
dc.typemasterThesis
thesis.degree.nameDissertação de mestrado -Engenharia Informáticapor

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
Mestrado-Engenharia_Informatica-David_Laranjo_Pinto.pdf
Size:
1.66 MB
Format:
Adobe Portable Document Format

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
3.89 KB
Format:
Item-specific license agreed upon to submission
Description: