Resolvendo Captchas: usando raspagem de dados e aprendizado fracamente supervisionado

Trecenti, Julio Adolfo Zucon

doi:10.11606/T.45.2023.tde-20042023-113409

Accueil

Services

Thèse de Doctorat

DOI

https://doi.org/10.11606/T.45.2023.tde-20042023-113409

Document

Thèse de Doctorat

Auteur

Trecenti, Julio Adolfo Zucon (Catálogo USP)

Nom complet

Julio Adolfo Zucon Trecenti

Unité de l'USP

Instituto de Matemática e Estatística

Domain de Connaissance

Statistiques

Date de Soutenance

2023-03-31

Editeur

São Paulo, 2023

Directeur

Fossaluza, Victor (Catálogo USP)

Jury

Fossaluza, Victor (Président)
Izbicki, Rafael
Leonardi, Florencia Graciela
Pinto Junior, Jony Arrais
Zuanetti, Daiane Aparecida

Titre en portugais

Resolvendo Captchas: usando raspagem de dados e aprendizado fracamente supervisionado

Mots-clés en portugais

Aprendizado de máquinas
Aprendizado estatístico
Aprendizado fracamente supervisionado
Captcha
Raspagem de dados
Rótulos parciais

Resumé en portugais

Captcha (Completely Automated Public Turing tests to tell Computers and Humans Apart), é um desafio utilizado para identificar se o acesso à uma página na internet é realizada por uma pessoa ou uma máquina. O desafio é projetado para ser fácil de resolver por humanos, mas difícil de resolver por máquinas. A utilização de Captchas em serviços públicos pode ser prejudicial à população, limitando o acesso a dados e incentivando empresas a contratarem serviços que utilizam mão de obra humana para resolução dos Captchas. Este trabalho tem como foco os Captchas com textos (números e letras) em imagens. Já existem soluções para resolver Captchas deste tipo utilizando aprendizado de máquinas, sendo as redes neurais profundas os modelos com melhor desempenho. No entanto, esses modelos precisam de grandes bases de dados anotadas ou de procedimentos de ajuste intrincados e pouco acessíveis. Neste trabalho, é proposto um método inovador, chamado Web Automatic Weak Learning (WAWL), que alia técnicas de raspagem de dados e aprendizado de máquinas com rótulos parciais, utilizando dados obtidos automaticamente da internet para acelerar o ajuste dos modelos. O método é agnóstico à arquitetura utilizada para o modelo, sendo necessário realizar apenas uma adaptação na função de perda. O método apresenta resultados significativos, aumentando a acurácia inicial de modelos fracos em mais de 30\% nos mais de 10 Captchas estudados, sem a necessidade de realizar uma nova rodada de anotação manual. Adicionalmente, um novo pacote computacional de uso livre foi desenvolvido para resolver Captchas e disponibilizar os resultados publicamente. Espera-se que o trabalho possa reduzir o incentivo econômico de contratar serviços que utilizam mão de obra humana para resolver Captchas.

Titre en anglais

Solving Captchas: using web scraping and weak supervised learning

Mots-clés en anglais

Captcha
Machine learning
Partial label
Statistical learning
Weak supervised learning
Web scraping

Resumé en anglais

Captchas, or Completely Automated Public Turing tests to tell Computers and Humans Apart, are challenges designed to differentiate between human and machine access to web pages. While Captchas are intended to be easy for humans to solve, they can pose a challenge for machines. Their use in public services can limit access to public data and incentivize companies to hire services that use human labor to solve them. In this work, we propose a new method called Web Automatic Weak Learning (WAWL), which combines web scraping and machine learning with partial labels techniques to quickly and accurately fit models to solve Captchas with text in images. Our method is agnostic to the model architecture and only requires a small adaptation of the loss function. By increasing the accuracy of weak initial models by more than 30% on various Captchas studied, our method can reduce the economic incentive to hire services that use human labor to solve Captchas. We have also developed a computational package to easily solve Captchas and make our results available to the developer community.

AVERTISSEMENT - Regarde ce document est soumise à votre acceptation des conditions d'utilisation suivantes:
Ce document est uniquement à des fins privées pour la recherche et l'enseignement. Reproduction à des fins commerciales est interdite. Cette droits couvrent l'ensemble des données sur ce document ainsi que son contenu. Toute utilisation ou de copie de ce document, en totalité ou en partie, doit inclure le nom de l'auteur.

tese_doutorado_jtrecenti.pdf (2.99 Mbytes)

Date de Publication

2023-04-20

Œvres dérivées

AVERTISSEMENT: Apprenez ce que sont des œvres dérivées cliquant ici.