Resolvendo Captchas: usando raspagem de dados e aprendizado fracamente supervisionado

Trecenti, Julio Adolfo Zucon

doi:10.11606/T.45.2023.tde-20042023-113409

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Tese de Doutorado

DOI

https://doi.org/10.11606/T.45.2023.tde-20042023-113409

Documento

Tese de Doutorado

Autor

Trecenti, Julio Adolfo Zucon (Catálogo USP)

Nome completo

Julio Adolfo Zucon Trecenti

Unidade da USP

Instituto de Matemática e Estatística

Área do Conhecimento

Estatística

Data de Defesa

2023-03-31

Imprenta

São Paulo, 2023

Orientador

Fossaluza, Victor (Catálogo USP)

Banca examinadora

Fossaluza, Victor (Presidente)
Izbicki, Rafael
Leonardi, Florencia Graciela
Pinto Junior, Jony Arrais
Zuanetti, Daiane Aparecida

Título em português

Resolvendo Captchas: usando raspagem de dados e aprendizado fracamente supervisionado

Palavras-chave em português

Aprendizado de máquinas
Aprendizado estatístico
Aprendizado fracamente supervisionado
Captcha
Raspagem de dados
Rótulos parciais

Resumo em português

Captcha (Completely Automated Public Turing tests to tell Computers and Humans Apart), é um desafio utilizado para identificar se o acesso à uma página na internet é realizada por uma pessoa ou uma máquina. O desafio é projetado para ser fácil de resolver por humanos, mas difícil de resolver por máquinas. A utilização de Captchas em serviços públicos pode ser prejudicial à população, limitando o acesso a dados e incentivando empresas a contratarem serviços que utilizam mão de obra humana para resolução dos Captchas. Este trabalho tem como foco os Captchas com textos (números e letras) em imagens. Já existem soluções para resolver Captchas deste tipo utilizando aprendizado de máquinas, sendo as redes neurais profundas os modelos com melhor desempenho. No entanto, esses modelos precisam de grandes bases de dados anotadas ou de procedimentos de ajuste intrincados e pouco acessíveis. Neste trabalho, é proposto um método inovador, chamado Web Automatic Weak Learning (WAWL), que alia técnicas de raspagem de dados e aprendizado de máquinas com rótulos parciais, utilizando dados obtidos automaticamente da internet para acelerar o ajuste dos modelos. O método é agnóstico à arquitetura utilizada para o modelo, sendo necessário realizar apenas uma adaptação na função de perda. O método apresenta resultados significativos, aumentando a acurácia inicial de modelos fracos em mais de 30\% nos mais de 10 Captchas estudados, sem a necessidade de realizar uma nova rodada de anotação manual. Adicionalmente, um novo pacote computacional de uso livre foi desenvolvido para resolver Captchas e disponibilizar os resultados publicamente. Espera-se que o trabalho possa reduzir o incentivo econômico de contratar serviços que utilizam mão de obra humana para resolver Captchas.

Título em inglês

Solving Captchas: using web scraping and weak supervised learning

Palavras-chave em inglês

Captcha
Machine learning
Partial label
Statistical learning
Weak supervised learning
Web scraping

Resumo em inglês

Captchas, or Completely Automated Public Turing tests to tell Computers and Humans Apart, are challenges designed to differentiate between human and machine access to web pages. While Captchas are intended to be easy for humans to solve, they can pose a challenge for machines. Their use in public services can limit access to public data and incentivize companies to hire services that use human labor to solve them. In this work, we propose a new method called Web Automatic Weak Learning (WAWL), which combines web scraping and machine learning with partial labels techniques to quickly and accurately fit models to solve Captchas with text in images. Our method is agnostic to the model architecture and only requires a small adaptation of the loss function. By increasing the accuracy of weak initial models by more than 30% on various Captchas studied, our method can reduce the economic incentive to hire services that use human labor to solve Captchas. We have also developed a computational package to easily solve Captchas and make our results available to the developer community.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

tese_doutorado_jtrecenti.pdf (2.99 Mbytes)

Data de Publicação

2023-04-20

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.