AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

Di cosa parla

RealisticTritonBench trasforma modifiche vere tratte da progetti open-source che riguardano i kernel di Triton (pezzi di codice che eseguono calcoli critici) in compiti concreti: ricevi una specifica in linguaggio naturale e devi fornire il codice con un ambiente di test riproducibile. Diversamente dai test isolati, i kernel vengono inseriti nel loro contesto originale e valutati sull'intero flusso operativo; i modelli di linguaggio (software che generano codice da testo) faticano ancora.

Cosa permette di osservare

Consente di esplorare fino a che punto i modelli di linguaggio possono sostituire o assistere gli sviluppatori nella scrittura di kernel complessi e quanto le valutazioni realistiche cambino la percezione delle loro capacità in contesti di produzione.

hardwaremodelli linguisticiopen sourceregolamentazionericerca

Dalla fonte

In modern AI frameworks, GPU kernels are key to overall system performance. Combining usability, portability, and near-handwritten CUDA performance, Triton is widely adopted for implementing GPU kernels. Recent advances show the potential of large language models (LLMs) to automatically generate Triton kernels, reducing the manual effort required from expert kernel developers. Several benchmarks evaluate LLM-generated Triton kernels. However, they suffer from three key limitations: (1) they restrict tasks to PyTorch-to-Triton translation, failing to reflect the diversity and complexity of real-world Triton tasks; (2) they evaluate only individual-kernel performance rather than end-to-end performance, the core criterion for real-world deployment in AI frameworks; and (3) they rely on manually written evaluation scripts for individual kernels, which may contain flaws that models can explo…