Avaliação Sistemática de Estratégias de Correção Automática de Questões Abertas em Engenharia de Software com LLMs
Este trabalho investiga estratégias de correção automática de questões abertas em Engenharia de Software com apoio de LLMs. A partir da plataforma desenvolvida no Projeto Orientado em Computação I, o POC II concentrou-se em comparar protocolos de correção usando um mesmo modelo, com o objetivo de medir qual estratégia produz avaliações mais aderentes às rubricas.
Para isso, foi consolidado um banco com 57 questões abertas, organizadas em quatro eixos: correção de bugs, qualidade de código, testes e arquitetura. Também foi construído um conjunto experimental com 8 questões e 24 respostas de referência. Essas respostas foram elaboradas manualmente a partir das soluções esperadas de cada questão e receberam notas esperadas para cada critério da rubrica.
Foram comparadas três estratégias: avaliação direta, avaliação com revisão e avaliações agregadas. Os resultados indicaram que as avaliações agregadas obtiveram o menor erro global e por critério, apresentando maior aderência à rubrica. A avaliação direta, por outro lado, teve desempenho próximo com menor custo e latência, configurando-se como a melhor alternativa de custo-benefício. Já a avaliação com revisão não superou a avaliação direta na configuração oficial, embora análises exploratórias indiquem que prompts de revisão melhor calibrados constituem uma direção promissora para validação futura.
Conclui-se que, na correção automática de respostas abertas, o protocolo de avaliação influencia diretamente qualidade, custo e tempo de execução. O trabalho reforça a importância de rubricas claras, respostas de referência e métricas por critério para avaliar o uso de LLMs como apoio à correção técnica.
2026/1 - POC2
Orientador: Marco Túlio de Oliveira Valente
Palavras-chave: correção automática de respostas abertas, modelos de linguagem, correção baseada em rubricas, Engenharia de Software, avaliação técnica, respostas de referência
PDF Disponível