Aprendizagem de Classificadores para Identificação de Bactérias: relação entre as medidas de complexidade de dados e o desempenho dos classificadores

dc.contributor.advisor1Rocha, José Carlos Ferreira da
dc.contributor.advisor1Latteslattes.cnpq.brpt_BR
dc.contributor.instituicao-banca1Universidade Estadual de Ponta Grossapt_BR
dc.contributor.instituicao-banca2Universidade Federal do Paranápt_BR
dc.contributor.referee1Britto Junior, Alceu de Souza
dc.contributor.referee1Latteslattes.cnpq.brpt_BR
dc.contributor.referee2Steffens, Maria Berenice Reynaud
dc.creatorFedacz, Gabriel Lucas
dc.creator.ID08297252965pt_BR
dc.creator.Latteslattes.cnpq.brpt_BR
dc.date.accessioned2020-11-25T18:52:21Z
dc.date.accessioned2026-06-30T17:59:39Z
dc.date.available2020-11-25T00:00:00Z
dc.date.available2020-11-25T18:52:21Z
dc.date.issued2020-07-28
dc.description.abstractIn the agricultural environment, some bacteria have been used as active in biocontrol and plant growth. This has motivated the development of software tools to automatically detect their presence in soil samples. One way to proceed with this identification is the development of classifiers that use MALDI / TOF mass spectra patterns to check the frequency of certain ribosomal proteins in the sample. The selection of a classification function that fits the target problem has a great influence on the classifier’s performance, this has encouraged the use of scores, called data complexity measures. Such scores describe certain characteristics of the database and may provide support for choosing the classification function. During the process of generating data from mass spectrometry, it is common for data to be unbalanced, which adversely affects the data complexity measures. Considering the above, this work applies an experimental protocol to verify the influence of unbalanced data on the performance of classifiers and on complexity measures. The classifying models used in the experiments were logistic regression and QDA, which were trained to identify bacteria of the genera Bacillus and Rhizobium. The performance of the classifiers showed a strong to moderate relationship with the unbalanced data problem. Two data complexity indexes, L2B and N3B, have been proposed and submitted to tests along with the indexes found in the literature. The results show that the measures F3, Density, N3B and L2B are related to the performance of the classifiers trained with unbalanced data. Such measures were evaluated for their ability to predict the balanced accuracy of the models. When identifying bacteria of the genera Bacillus, the measure of best relation to the performance of the models was the N3B measure. In the case of the identification of the genera Rhizobium, the measure of best association with the logistic model was L2B and N3B for the quadratic model.pt_BR
dc.description.resumoNo meio agrícola, algumas bactérias têm sido utilizadas na promoção do biocontrole e crescimento vegetal. Isto tem motivado o desenvolvimento de ferramentas de software para detectar automaticamente sua presença em amostras coletadas do solo. Uma maneira de proceder tal identificação é o desenvolvimento de classificadores que utilizam padrões de espectros de massa obtido por MALDI/TOF para verificar a frequência de determinados conjuntos de proteínas ribossomais na amostra. A seleção de uma função de classificação adequada para o problema alvo tem grande influência sobre o desempenho do classificador e isto tem incentivado o uso de escores, denominados medidas de complexidade de dados. Tais escores descrevem certas características da base dados e podem fornecer suporte à escolha da função de classificação. Durante o processo de geração dos dados a partir de espectros de massa, é comum a ocorrência do desbalanceamento de classes, o que afeta adversamente as medidas de complexidade de dados. Considerando o exposto, este trabalho aplica um protocolo experimental para verificar a influência do desbalanceamento dos dados sobre o desempenho dos classificadores e nas medidas de complexidade. Os modelos classificadores utilizados nos experimentos foram a regressão logística e o QDA, os quais foram treinados para a identificação de bactérias dos gêneros Bacillus e Rhizobium. O desempenho dos classificadores apresentou relação exponencial com o balanceamento dos dados. Foram propostos dois índices de complexidade de dados, L2B e N3B que foram submetidas aos testes junto aos índices encontrados na literatura. Os resultados mostram que as medidas F3, Density, N3B e L2B estão relacionados ao desempenho dos classificadores treinados com dados desbalanceados. Tais medidas foram avaliadas quanto a capacidade em predizer a acurácia balanceada dos modelos. Na identificação de bactérias do gênero Bacillus, a medida de melhor relação com o desempenho em ambos os modelos foi a medida N3B. No caso da identificação do gênero Rhizobium, a medida de melhor associação ao modelo logístico foi L2B e N3B no modelo quadrático.pt_BR
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superiorpt_BR
dc.identifier.citationFEDACZ, Gabriel Lucas. Aprendizagem de Classificadores para Identificação de Bactérias: relação entre as medidas de complexidade de dados e o desempenho dos classificadores. 2020. Dissertação (Mestrado em Computação Aplicada) - Universidade Estadual de Ponta Grossa, Ponta Grossa, 2020.pt_BR
dc.identifier.urihttps://ri.uepg.br/handle/123456789/3337
dc.languageporpt_BR
dc.publisherUniversidade Estadual de Ponta Grossapt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.departmentDepartamento de Informáticapt_BR
dc.publisher.initialsUEPGpt_BR
dc.publisher.programPrograma de Pós Graduação Computação Aplicadapt_BR
dc.rightsAcesso Abertopt_BR
dc.rightsAttribution-NonCommercial-NoDerivs 3.0 Brazil
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/3.0/br/
dc.subjectComplexidade de dadospt_BR
dc.subjectEspectrometria de Massapt_BR
dc.subjectClassificação de Bactériaspt_BR
dc.subjectDesbalanceamento de dadospt_BR
dc.subjectData Complexitypt_BR
dc.subjectMass Spectrometrypt_BR
dc.subjectBacterial Classificationpt_BR
dc.subjectImbalanced Datasetspt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
dc.titleAprendizagem de Classificadores para Identificação de Bactérias: relação entre as medidas de complexidade de dados e o desempenho dos classificadorespt_BR
dc.typeDissertaçãopt_BR

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
Gabriel Lucas Fedacz.pdf
Size:
5.39 MB
Format:
Adobe Portable Document Format
Description:
dissertação completa em pdf

License bundle

Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.82 KB
Format:
Item-specific license agreed to upon submission
Description:
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.24 KB
Format:
Item-specific license agreed to upon submission
Description: