RBS-Attention: nuova tecnica sparse-prefill per LLM a lungo contesto
RBS-Attention introduce un approccio sparse‑prefill senza addestramento, combinando una branch basata su centroidi e una di salvataggio per mitigare il problema di "mean dilution" nei LLM a lungo contesto.

### Un nuovo approccio al prefill nei modelli a lungo contesto Il prefill, fase in cui l'autoregressione elabora l'intero prompt, è diventato il collo di bottiglia per l'inferenza di grandi modelli linguistici (LLM) con contesti estesi. La tecnica tradizionale di self‑attention densa richiede un'elaborazione completa di tutti i token, aumentando drasticamente i costi computazionali.
### Sparse block selection e il problema della "mean dilution" L'uso di blocchi sparsi può ridurre il carico, ma la media dei centroidi rischia di nascondere token altamente rilevanti tra molti irrilevanti, fenomeno definito dagli autori come *mean dilution*.
### RBS-Attention: due branche complementari RBS-Attention propone una soluzione training‑free basata su due rami di selezione. Il ramo centroid base cattura la rilevanza media dei blocchi, mentre il ramo rescue analizza il raggio massimo delle chiavi del blocco, tenendo conto di prompt, layer e testa, per individuare blocchi potenzialmente sottostimati.
### Implementazione e performance Le due branche vengono soggette a soglie indipendenti e i loro mascheramenti vengono combinati, garantendo che i blocchi di salvataggio contribuiscano senza interrompere l'esecuzione regolare di FlashAttention a blocchi sparsi. I test su GPU H100 mostrano che RBS-Attention riduce il costo del prefill mantenendo l'efficienza dell'operazione.
### Implicazioni per la ricerca e l'industria Questa metodologia, descritta nel paper arXiv 2609.20971v1, offre una via promettente per scalare LLM a contesti molto lunghi senza richiedere ulteriori fasi di addestramento, aprendo nuove opportunità sia per la ricerca accademica sia per le applicazioni commerciali.
*Fonte: arXiv cs.AI, 2026-09-21*
Leggi anche

Modelli più avanzati, sistemi più rischiosi nei mercati finanziari
LLM più potenti possono peggiorare le performance di sistemi complessi, generando rischi sistemici.

Allarme AI: un'illusione quasi avvia un'operazione militare USA
Un esperto GovAI mette in guardia i militari sul rischio di allucinazioni dei modelli linguistici, dopo un episodio quasi fatale.

Fine-tuning: come cambia la struttura interna dei LLM
Una ricerca su arXiv esplora le trasformazioni interne dei LLM dopo il fine-tuning, scoprendo una concentrazione dei componenti chiave in specifici strati.
Ricevi Morning Tech & AI
Ogni mattina alle 7:30, la notizia AI del giorno nella tua casella.
Iscriviti