Falhas em softwares fazem parte do cotidiano digital e podem afetar desde aplicativos de celular até sistemas bancários e plataformas de serviços públicos. Identificar esses erros antes que cheguem aos usuários é uma etapa essencial, e custosa, do desenvolvimento tecnológico. Para enfrentar esse desafio, pesquisadores da Universidade Federal do Rio Grande do Norte (UFRN) investigaram como modelos menores e mais acessíveis de inteligência artificial podem tornar os testes de software mais eficientes, seguros e democráticos.
O estudo, publicado no Simpósio Brasileiro de Engenharia de Software (SBES), comparou o desempenho de modelos de linguagem de grande porte, conhecidos como Large Language Models (LLMs), como GPT e Gemini, com versões menores e abertas, chamadas de small-scale LLMs. Segundo o técnico de tecnologia da informação da Secretaria de Educação a Distância (Sedis/UFRN), Esdras Silva, autor do trabalho desenvolvido no âmbito do Programa de Pós-graduação em Sistemas e Computação (PPgSC), os resultados mostraram que modelos de menor escala conseguem gerar testes de software com desempenho semelhante aos modelos maiores e, em alguns aspectos, até superior.

Entre os principais achados, alguns modelos menores se destacaram por detectar falhas no código com mais eficiência, medida por uma métrica conhecida como mutation score, que avalia a capacidade dos testes de encontrar erros reais. Além disso, modelos do Google geram testes com menor quantidade de problemas estruturais, indicando maior aderência a práticas de códigos legíveis e consistentes, em comparação com modelos de outros fornecedores.
Para chegar a esses resultados, os pesquisadores analisaram 18 modelos de inteligência artificial, sendo 12 de pequeno porte e seis de grande escala, aplicados a sete projetos de software escritos em Java. E, para isso, foi desenvolvida uma ferramenta própria. “Utilizamos a ferramenta ChatTester, que transforma modelos de linguagem em agentes capazes de gerar testes automatizados e corrigir erros de compilação”, explicou Esdras.
Os resultados indicaram que alguns modelos menores, como Gemma, xLAM e DeepSeekCoder, apresentaram desempenho comparável ao de sistemas muito maiores, especialmente na detecção de falhas no software. Em alguns cenários, esses modelos conseguiram identificar mais erros do que alternativas amplamente utilizadas, reforçando que o tamanho da inteligência artificial não é o único fator determinante para sua eficácia.

Impactos sociais e ambientais
Do ponto de vista social, o impacto da pesquisa é significativo. “A adoção de modelos menores pode reduzir a dependência de grandes data centers, permitindo que desenvolvedores utilizem modelos localmente em seus próprios computadores”, destacou Esdras. “Isso diminui o consumo de recursos computacionais, melhora a privacidade dos dados e reduz riscos relacionados à segurança da informação, além de democratizar o acesso a ferramentas avançadas de apoio ao desenvolvimento de software.”
A execução dos experimentos em larga escala teve apoio do Núcleo de Processamento de Alto Desempenho (NPAD/UFRN), unidade de supercomputação da UFRN. O uso dessa infraestrutura permitiu acelerar significativamente o trabalho. “O NPAD foi essencial para a execução dos experimentos, possibilitando que, os testes, nos sete projetos, fossem realizados em uma semana, em vez de aproximadamente um mês”, relatou o pesquisador.
Os próximos passos da pesquisa apontam para novos domínios de aplicação. O grupo, composto pelas pesquisadoras Roberta Coelho e Lyrene Silva, pretende estender a abordagem para o desenvolvimento de jogos digitais, um campo marcado por sistemas interativos e altamente dinâmicos. A expectativa é abrir novas frentes de investigação e ampliar o uso da inteligência artificial em áreas cada vez mais complexas do desenvolvimento de software.
Fonte: NPAD/UFRN











































































Comentários