Download
Morning Tech & AI
Ricerca2 min di lettura

RBS-Attention: nuova tecnica sparse-prefill per LLM a lungo contesto

RBS-Attention introduce un approccio sparse‑prefill senza addestramento, combinando una branch basata su centroidi e una di salvataggio per mitigare il problema di "mean dilution" nei LLM a lungo contesto.

21 settembre 2026·Fonte: arXiv cs.AI·Assistito da AI
RBS-Attention: nuova tecnica sparse-prefill per LLM a lungo contesto

### Un nuovo approccio al prefill nei modelli a lungo contesto Il prefill, fase in cui l'autoregressione elabora l'intero prompt, è diventato il collo di bottiglia per l'inferenza di grandi modelli linguistici (LLM) con contesti estesi. La tecnica tradizionale di self‑attention densa richiede un'elaborazione completa di tutti i token, aumentando drasticamente i costi computazionali.

### Sparse block selection e il problema della "mean dilution" L'uso di blocchi sparsi può ridurre il carico, ma la media dei centroidi rischia di nascondere token altamente rilevanti tra molti irrilevanti, fenomeno definito dagli autori come *mean dilution*.

### RBS-Attention: due branche complementari RBS-Attention propone una soluzione training‑free basata su due rami di selezione. Il ramo centroid base cattura la rilevanza media dei blocchi, mentre il ramo rescue analizza il raggio massimo delle chiavi del blocco, tenendo conto di prompt, layer e testa, per individuare blocchi potenzialmente sottostimati.

### Implementazione e performance Le due branche vengono soggette a soglie indipendenti e i loro mascheramenti vengono combinati, garantendo che i blocchi di salvataggio contribuiscano senza interrompere l'esecuzione regolare di FlashAttention a blocchi sparsi. I test su GPU H100 mostrano che RBS-Attention riduce il costo del prefill mantenendo l'efficienza dell'operazione.

### Implicazioni per la ricerca e l'industria Questa metodologia, descritta nel paper arXiv 2609.20971v1, offre una via promettente per scalare LLM a contesti molto lunghi senza richiedere ulteriori fasi di addestramento, aprendo nuove opportunità sia per la ricerca accademica sia per le applicazioni commerciali.

*Fonte: arXiv cs.AI, 2026-09-21*

#LLM#self-attention#sparse attention#GPU H100

Ricevi Morning Tech & AI

Ogni mattina alle 7:30, la notizia AI del giorno nella tua casella.

Iscriviti
Shellonback

Preferenze cookie

Scegli quali categorie di cookie accettare. I cookie tecnici e funzionali sono sempre attivi.

Per maggiori informazioni, consulta la nostra Cookie Policy e la Privacy Policy.

Cookie di profilazione

Utilizzati per creare profili relativi all'utente e inviare messaggi promozionali in linea con le preferenze espresse.

Cookie analitici

Ci permettono di capire come gli utenti navigano il sito per migliorare l'esperienza e i contenuti.

Cookie tecnici

Sempre attivo

Necessari per il funzionamento del sito. Non possono essere disattivati.

Cookie funzionali

Sempre attivo

Consentono funzionalità avanzate come la memorizzazione delle preferenze di navigazione.