Authorship attribution using co-occurrence networks
| dc.contributor.advisor | Ferreira, Lígia Maria | |
| dc.contributor.author | Pires, David Laranjo | |
| dc.date.accessioned | 2022-01-25T18:45:16Z | |
| dc.date.available | 2022-01-25T18:45:16Z | |
| dc.date.issued | 2021-11-02 | |
| dc.description.abstract | Atribuição de Autoria utlizando Redes de Co-Ocorrencia Nesta tese é abordada a tarefa de Atribuição de Autoria como uma tarefa de classificação. As metodologias utilizadas representam textos em grafos. Destes, várias medidas são extraídas, sendo utilizadas como amostras para o classificador. Já existem alguns trabalhos que também se focam nesta metodologia. Esta tese foca-se num método que divide o texto em várias partes e trata cada uma como um grafo. Deste, são extraídas as medidas, que são tratadas como uma série temporal, da qual são extraídos momentos. Assim, os momentos compõem o vetor final, representativo de todo o texto. A partir da metodologia aqui descrita surgem mais duas variações. A primeira variação omite o passo das séries temporais, e, por consequência, as várias medidas de cada grafo são utilizadas diretamente como amostras. A segunda variação representa todo o texto como um só grafo. As metodologias são testadas com corpus em Inglês e Português, com número variado de textos; Abstract: Authorship Attribution using Co-Occurrence Networks This thesis approaches the task of Authorship Attribution as a classification task. This is done using methodologies that represent text documents in graphs, from which several measures are extracted, to be used as samples for the classifier. There have been some works that also focus on this methodology. This thesis focuses on a methodology which splits the texts in multiple parts and treats each as a separate graph, from which measures are extracted. Each graph’s measures are treated as a time-series and moments are extracted. These moments make the final vector, representative of the entire text. This methodology is explored and extended with 2 variations. The first variation skips the time-series step, resulting in the various measures from each graph being used directly as samples. The second variation models the entire text as one graph. The methodologies are tested in corpus in both English and Portuguese, with varying number of texts. | por |
| dc.identifier.authoremail | faladouro@hotmail.com | |
| dc.identifier.scientificarea | 498 | por |
| dc.identifier.sharewith | Departamento de Engenharia Informática | por |
| dc.identifier.tid | 202898156 | por |
| dc.identifier.uri | http://hdl.handle.net/10174/30831 | |
| dc.language.iso | eng | por |
| dc.publisher | Universidade de Évora | por |
| dc.rights | openAccess | por |
| dc.subject | Atribuição de Autoria | por |
| dc.subject | Processamento de Lingua Natural | por |
| dc.subject | Grafos | por |
| dc.subject | Redes de co-ocorrencia | por |
| dc.subject | Classificação | por |
| dc.subject | Authorship Attribution | por |
| dc.subject | Natural Language Processing | por |
| dc.subject | Graphs | por |
| dc.subject | Co-Occurrence Networks | por |
| dc.subject | Classification | por |
| dc.title | Authorship attribution using co-occurrence networks | por |
| dc.type | masterThesis | |
| thesis.degree.name | Dissertação de mestrado -Engenharia Informática | por |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- Mestrado-Engenharia_Informatica-David_Laranjo_Pinto.pdf
- Size:
- 1.66 MB
- Format:
- Adobe Portable Document Format
License bundle
1 - 1 of 1
Loading...
- Name:
- license.txt
- Size:
- 3.89 KB
- Format:
- Item-specific license agreed upon to submission
- Description: