Privacy-preserving federated learning with homomorphic encryption resilient to gradient reconstruction attacks : a study on medical named entity recognition.

Registro completo de metadados
MetadadosDescriçãoIdioma
Autor(es): dc.contributorSilva, Rodrigo Cesar Pedrosa-
Autor(es): dc.contributorSilva, Rodrigo Cesar Pedrosa-
Autor(es): dc.contributorSilva, Pedro Henrique Lopes-
Autor(es): dc.contributorGuimarães, Frederico Gadelha-
Autor(es): dc.creatorRezende, Marcos Felipe Pontes-
Data de aceite: dc.date.accessioned2026-08-11T11:23:46Z-
Data de disponibilização: dc.date.available2026-08-11T11:23:46Z-
Data de envio: dc.date.issued2026-07-29-
Data de envio: dc.date.issued2025-
Fonte completa do material: dc.identifierhttps://www.repositorio.ufop.br/handle/123456789/21430-
Fonte: dc.identifier.urihttp://educapes.capes.gov.br/handle/capes/1187836-
Descrição: dc.descriptionPrograma de Pós-Graduação em Ciência da Computação. Departamento de Ciência da Computação, Instituto de Ciências Exatas e Biológicas, Universidade Federal de Ouro Preto.-
Descrição: dc.descriptionMedical Named Entity Recognition (MNER) is a critical task for extracting and organizing medical knowledge from unstructured data, which is essential for health monitoring and clinical decision-making. Despite advancements in Deep Learning (DL), in particular with Large Language Models (LLMs), these tasks still face sig- nificant challenges due to the limited availability and dispersion of labeled data across institutions, often protected under privacy regulations. Federated Learning (FL) provides a promising solution by enabling collaborative model training with decentralized data. However, the core tenet of FL—"sharing models instead of data"—does not inherently guarantee training data confidentiality. Traditional FL remains vulnerable to Feature Inference Attacks (FIA), where model updates trans- mitted during training are exploited to leak sensitive information about the private local datasets. This work investigates a specific class of FIAs called Gradient Recon- struction Attacks (GRAs). These attacks exploit the high-dimensional information contained in model gradients to reverse-engineer the original inputs used during lo- cal training. In the first phase of the thesis, we conducted a systematic vulnerability analysis by applying different GRAs, specifically DLG, TAG, and LAMP, to BERT- based models in the context o MNER tasks. Our results demonstrate that FL is indeed vulnerable to these exploits in token classification tasks, with Recover Rate reaching 74.0%, 63.4%, and 62.8% for CONLL, BC4CHEMD, and BC2GM datasets, respectively, with LAMP on BERTblue. We also find that increasing the batch size and problems like out-of-order and crosstalk reduce reconstruction quality, but do not fully eliminate the risk of sensitive medical entity exposure. To defend against these vulnerabilities, the second phase of this research introduces FedHE, a defense framework that integrates Homomorphic Encryption (HE) to ensure secure gradient aggregation. We evaluate the trade-offs between model compactness, predictive ac- curacy, and computational overhead across a spectrum of BERT architectures. The FedHE evaluation shows that the application of HE introduces significant memory and bandwidth overheads, especially with larger models, making it impractical in the evaluated setting for state-of-the-art models such as BERTblue. The study finds that compact models like BERTtiny and BERTmini are more feasible in terms of resource usage and still achieve competitive performance. While the HE encryption process increases computational costs, the study shows that HE does not negatively impact model performance.-
Descrição: dc.descriptionO Reconhecimento de Entidades Nomeadas Médicas (MNER) é uma tarefa crítica para extrair e organizar conhecimento médico a partir de dados não estruturados, sendo essencial para o monitoramento de saúde e a tomada de decisões clínicas. Ape- sar dos avanços em Deep Learning (DL), em particular com Large Language Models (LLMs), essas tarefas ainda enfrentam desafios significativos devido à disponibili- dade limitada de dados e à dispersão de dados rotulados entre diferentes instituições, frequentemente protegidas por regulamentações de privacidade. O Aprendizado Fed- erado (FL) oferece uma solução promissora ao permitir treinamento colaborativo com dados descentralizados. No entanto, o princípio de "compartilhar atualiza- ções de modelos em vez de dados" não garante, por si só, a confidencialidade dos dados de treino. O FL tradicional permanece vulnerável a Feature Inference At- tacks (FIA), em que atualizações de modelo são exploradas para vazar informações confidenciais dos conjuntos de dados locais privados. Este trabalho investiga uma classe específica de FIAs chamada Gradient Reconstruction Attack (GRA). Esses ataques exploram as informações contidas nos gradientes para reconstruir os da- dos usados no treinamento local. Na primeira fase desta tese, conduzimos uma análise de vulnerabilidade aplicando diferentes GRAs, especificamente DLG, TAG e LAMP, a modelos baseados em BERT para a tarefa de MNER. Os resultados mostram que o FL é vulnerável a esses ataques em tarefas de classificação de to- kens, com Recover Rate atingindo 74.0%, 63.4% e 62.8% para os conjuntos CONLL, BC4CHEMD e BC2GM, respectivamente, com o ataque LAMP e modelo BERTblue. Também observamos que fatores como o aumento do tamanho do batch ou prob- lemas de out-of-order e crosstalk reduzem a qualidade da reconstrução, mas não eliminam o risco de exposição de entidades médicas sensíveis. Para defender essas vulnerabilidades, a segunda fase da tese introduz o FedHE, um framework de de- fesa que integra Criptografia Homomórfica (HE) para garantir a agregação segura de gradientes. Avaliamos os trade-offs deste framework considerando tamanho do mod- elo, acurácia preditiva e sobrecarga computacional em um espectro de arquiteturas BERT. A avaliação do FedHE mostra que a aplicação de HE introduz sobrecargas significativas de memória e largura de banda, especialmente com modelos maiores, tornando impraticável o uso de modelos de estado da arte como o BERTblue. O es- tudo conclui que modelos compactos como BERTtiny e BERTmini são mais viáveis em termos de uso de recursos e ainda alcançam desempenho competitivo. Embora o processo de criptografia aumente os custos computacionais, o estudo mostra que o HE não impacta negativamente o desempenho do modelo.-
Formato: dc.formatapplication/pdf-
Idioma: dc.languagept_BR-
Direitos: dc.rightsaberto-
Direitos: dc.rightsAttribution 3.0 United States-
Direitos: dc.rightshttp://creativecommons.org/licenses/by/3.0/us/-
Direitos: dc.rightsAutorização concedida ao Repositório Institucional da UFOP pelo(a) autor(a) em 04/05/2026 com as seguintes condições: disponível sob Licença Creative Commons 4.0 que permite copiar, distribuir e transmitir o trabalho, desde que sejam citados o autor e o licenciante.-
Palavras-chave: dc.subjectAprendizado do computador-
Palavras-chave: dc.subjectCriptografia-
Palavras-chave: dc.subjectRecuperação de dados - computação-
Palavras-chave: dc.subjectProcessamento de linguagem natural - computação-
Título: dc.titlePrivacy-preserving federated learning with homomorphic encryption resilient to gradient reconstruction attacks : a study on medical named entity recognition.-
Tipo de arquivo: dc.typelivro digital-
Aparece nas coleções:Repositório Institucional - UFOP

Não existem arquivos associados a este item.