
Atenção:
O eduCAPES é um repositório de objetos educacionais, não sendo responsável por materiais de terceiros submetidos na plataforma. O usuário assume ampla e total responsabilidade quanto à originalidade, à titularidade e ao conteúdo, citações de obras consultadas, referências e outros elementos que fazem parte do material que deseja submeter. Recomendamos que se reporte diretamente ao(s) autor(es), indicando qual parte do material foi considerada imprópria (cite página e parágrafo) e justificando sua denúncia.
Caso seja o autor original de algum material publicado indevidamente ou sem autorização, será necessário que se identifique informando nome completo, CPF e data de nascimento. Caso possua uma decisão judicial para retirada do material, solicitamos que informe o link de acesso ao documento, bem como quaisquer dados necessários ao acesso, no campo abaixo.
Todas as denúncias são sigilosas e sua identidade será preservada. Os campos nome e e-mail são de preenchimento opcional. Porém, ao deixar de informar seu e-mail, um possível retorno será inviabilizado e/ou sua denúncia poderá ser desconsiderada no caso de necessitar de informações complementares.
| Metadados | Descrição | Idioma |
|---|---|---|
| Autor(es): dc.contributor | Sanches, Danilo Sipoli | - |
| Autor(es): dc.contributor | Sanches, Danilo Sipoli | - |
| Autor(es): dc.contributor | Watanabe, Willian Massami | - |
| Autor(es): dc.contributor | Shishido, Henrique Yoshikazu | - |
| Autor(es): dc.creator | Mello, Gustavo José da Silveira | - |
| Data de aceite: dc.date.accessioned | 2026-08-11T10:56:27Z | - |
| Data de disponibilização: dc.date.available | 2026-08-11T10:56:27Z | - |
| Data de envio: dc.date.issued | 2026-04-08 | - |
| Data de envio: dc.date.issued | 2026-04-08 | - |
| Data de envio: dc.date.issued | 2025-11-26 | - |
| Fonte completa do material: dc.identifier | http://repositorio.utfpr.edu.br/jspui/handle/1/40058 | - |
| Fonte: dc.identifier.uri | http://educapes.capes.gov.br/handle/capes/1185275 | - |
| Descrição: dc.description | The exponential growth of textual data in digital environments has driven the development of efficient techniques for automatic text classification. In this context, the appropriate choice of a vectorization technique is a determining factor for the performance of classification models. This work aims to analyze and compare the performance trends of different text vectorization approaches applied to the classification task, considering frequency-based methods such as Bag of Words and TF-IDF, models that explore se- mantic relations such as Word2Vec, Glove, and Doc2Vec, and recent transformer-based and deep learning techniques such as BERT, ALBERT, ROBERTA, E5, Instructor-XL, and GPT2. To this end, the IMDb Reviews and 20 Newsgroups textual datasets are used, along with natural language preprocessing techniques, covering distinct domains in order to ensure the generalization of the results and to allow an analysis of differences between datasets. The methodology involves the standardized application of each vector- ization technique to the preprocessed textual data, followed by the training of supervised classification models. The resulting vectors are used as input to traditional classification models, including Random Forest, LinearSVC, and Logistic Regression, enabling a uni- form comparative analysis among the different textual representations. The techniques are compared based on quantitative metrics, including primarily accuracy, F1-score, and processing time. The study aims to identify the advantages, trends, and limitations of each approach, considering factors such as predictive performance, computational complexity, and suitability to different types of textual data. The results are intended to support researchers and practitioners in selecting more effective textual representation methods for specific applications, promoting greater efficiency in automated text analysis systems, as well as mapping the aptitude of different approaches across the chosen datasets. | - |
| Descrição: dc.description | O crescimento exponencial de dados textuais em ambientes digitais tem impulsionado o desenvolvimento de técnicas eficientes para classificação automática de texto. Neste contexto, a escolha adequada da técnica de vetorização é um fator determinante para o desempenho dos modelos classificadores. Este trabalho tem como objetivo analisar e comparar a tendência do desempenho de diferentes abordagens de vetorização de texto aplicadas à tarefa de classificação, considerando métodos baseados em frequência, como Bag of Words e TF-IDF, modelos que exploram relações semânticas, como Word2Vec, GloVe e Doc2Vec, e técnicas recentes baseadas em transformadores e aprendizado profundo, como BERT, ALBERT, ROBERTA, E5, Instructor-XL e GPT2. Para isso, são utilizados os conjuntos de dados textuais IMDb Reviews e 20 Newsgroups, juntamente com técnicas de pré-processamento de linguagem natural, abrangendo domínios distintos com o intuito de garantir a generalização dos resultados e analisar-se a diferença também entre conjuntos. A metodologia envolve a aplicação padronizada de cada técnica de vetorização nos dados textuais pré-processados, seguida do treinamento de modelos de classificação supervisionada. Os vetores resultantes são utilizados como entrada para modelos de classificação tradicionais, incluindo Random Forest, LinearSVC e Logistic Regression, permitindo uma análise comparativa uniforme entre as diferentes representações textuais. As técnicas são comparadas com base em métricas quantitativas, incluindo principalmente acurácia e F1-score e tempo de processamento. Espera-se identificar as vantagens, tendências e limitações de cada abordagem, considerando fatores como desempenho preditivo, complexidade computacional e adequação ao tipo de dado textual. Os resultados obtidos visam auxiliar pesquisadores e profissionais da área na escolha de métodos de representação textual mais eficazes para aplicações específicas, promovendo maior eficiência em sistemas automatizados de análise de texto, além de mapear a aptidão de diferentes abordagens nas bases de dados escolhidas. | - |
| Formato: dc.format | application/pdf | - |
| Idioma: dc.language | pt_BR | - |
| Publicador: dc.publisher | Universidade Tecnológica Federal do Paraná | - |
| Publicador: dc.publisher | Cornelio Procopio | - |
| Publicador: dc.publisher | Brasil | - |
| Publicador: dc.publisher | Engenharia da Computação | - |
| Publicador: dc.publisher | UTFPR | - |
| Direitos: dc.rights | openAccess | - |
| Direitos: dc.rights | Attribution-NonCommercial-ShareAlike 4.0 International | - |
| Direitos: dc.rights | http://creativecommons.org/licenses/by-nc-sa/4.0/ | - |
| Palavras-chave: dc.subject | Classificação | - |
| Palavras-chave: dc.subject | Textos | - |
| Palavras-chave: dc.subject | Processamento eletrônico de dados | - |
| Palavras-chave: dc.subject | Classification | - |
| Palavras-chave: dc.subject | Texts | - |
| Palavras-chave: dc.subject | Electronic data processing | - |
| Palavras-chave: dc.subject | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | - |
| Título: dc.title | Análise comparativa de técnicas de vetorização de texto na tarefa de classificação | - |
| Título: dc.title | Comparative analysis of text vectorization techniques in text classification task | - |
| Tipo de arquivo: dc.type | livro digital | - |
| Aparece nas coleções: | Repositorio Institucional da UTFPR - RIUT | |
O Portal eduCAPES é oferecido ao usuário, condicionado à aceitação dos termos, condições e avisos contidos aqui e sem modificações. A CAPES poderá modificar o conteúdo ou formato deste site ou acabar com a sua operação ou suas ferramentas a seu critério único e sem aviso prévio. Ao acessar este portal, você, usuário pessoa física ou jurídica, se declara compreender e aceitar as condições aqui estabelecidas, da seguinte forma: