CARREGANDO O RADAR…
Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models | Radar arXiv · portela.dev