CARREGANDO O RADAR…
How effective are traditional test criteria at detecting bugs in large language models generated code? | Radar arXiv · portela.dev