Looking for a Shorter Overview?
AI Summary
Key Moments
Impatto dell’harness su performance e costi
L’harness ottimizzato aumenta l’efficacia dell’agente e può dimezzare i costi operativi.Supervisore strategico nell’harness
Un componente supervisore riallinea l’agente quando si blocca o devia, migliorandone risultati e stabilità.Sfide dei compiti long-horizon
Compiti a lungo termine richiedono pianificazione, memoria e gestione errori, che solo un harness ben costruito può supportare.Stack agentico aperto per controllo e sicurezza
Offrire harness aperti restituisce controllo agli utenti e favorisce progressi sicuri nell’ecosistema IA.Nvidia dimostra che l’eroe non è il modello, ma l’“harness”
Nvidia ha pubblicato venerdì una nuova ricerca che lancia un messaggio chiaro: quando si chiede a un’IA di gestire compiti a lungo raggio, a contare davvero non è tanto il modello quanto l’“harness” — il rivestimento software che circonda il modello: strumenti, gestione della memoria, regole e flusso di lavoro che trasformano un modello grezzo in un agente capace di agire.
In pratica, l’harness è ciò che dà un cervello operativo all’IA: organizza memoria, contesto e feedback e la mantiene focalizzata nel tempo, soprattutto quando i passaggi da concatenare sono molti.
Il risultato che fa rumore: 100% su ARC-AGI-3
Il succo della ricerca è impressionante: adottando un harness personalizzato, ottimizzato per la memoria e con un componente “supervisore” in stile capo, i ricercatori hanno portato Claude Opus 5 a un punteggio del 100% su ARC-AGI-3, un benchmark di ragionamento interattivo composto da giochi 2D senza istruzioni, in cui il modello deve capire da solo come si gioca e come si vince, proprio come farebbe un umano. Senza harness, Opus 5 si fermava al 30% — che era comunque il miglior risultato tra i modelli testati.
Per un contesto: ARC-AGI-3 è una spina nel fianco di molti laboratori, in particolare di OpenAI, perché mette a nudo quanto poco “agenti” siano i modelli senza un’intelaiatura attorno.
Perché l’harness conta più del modello
Il messaggio di fondo è che la scelta del modello è importante, ma è solo una parte — spesso la più piccola — di un sistema agentico, soprattutto nei compiti a lungo raggio. L’harness è ciò che trasforma un modello in un agente: coordina strumenti, memoria, runtime, abilità e librerie.
Come sintetizza Adel El Hallak, VP Product della divisione AI di Nvidia: il mondo tende a vedere un agente come una semplice API del modello. In realtà un agente è il modello più tutta l’impalcatura attorno — l’harness — con i tool che usa, il runtime e le competenze a cui ha accesso.
Cosa sono i compiti “long-horizon”
Parliamo di attività in cui bisogna concatenare molte decisioni — a volte per giorni — per arrivare a un risultato finito. Non è la solita risposta singola a un prompt, ma un lavoro che richiede pianificazione, memoria, controllo di qualità e recupero dagli errori. Proprio qui gli agenti tendono a distrarsi, deragliare o fissarsi su percorsi sbagliati: tenerli in carreggiata è una delle sfide centrali della ricerca sugli agenti.
- Ad aprile, Microsoft ha testato 19 LLM su attività di editing documentale a lungo raggio: tutti, anche i modelli di frontiera, hanno riempito i documenti di errori — il tipo di output che a un essere umano costerebbe il posto.
- In altri contesti, agenti lasciati a se stessi hanno combinato disastri: dalla cancellazione di file o interi database, fino a comportamenti scorretti o illegali per raggiungere un obiettivo, tra collusione e tentativi di hacking.
L’elemento chiave: un “supervisore” che guida l’agente
La scelta di usare un benchmark di ragionamento interattivo rende ancora più significativo il risultato Nvidia: un 100% equivale a competenze umane in quei giochi. OpenAI, scottata dai punteggi bassissimi (meno del 10%) dei propri modelli su ARC-AGI-3, il mese scorso ha mostrato che, semplicemente ritoccando due impostazioni del proprio harness, le performance triplicano. Ma nessuno dei modelli è arrivato al 100% come nel lavoro Nvidia.
La differenza? Un supervisore nell’harness che interviene quando l’agente si blocca o devia. El Hallak lo descrive come un CEO che dà “spinte” strategiche: quando l’agente si infila in un vicolo cieco, o sta riesplorando inutilmente un percorso, il supervisore lo riallinea.
Questa idea non è del tutto nuova, ma oggi la maggior parte degli utenti si affida ad harness monostrato (Claude Code, Codex, Hermes). I ricercatori Nvidia hanno alzato l’asticella con un harness potenziato: gli Agentic Variation Operators (AVO).
- Non è un prodotto commerciale a sé.
- Nvidia mette a disposizione molti mattoni aperti per costruire harness sotto il brand Nemo: una parte è commerciale, molta tecnologia è fruibile liberamente.
Costi e performance: il harness fa la differenza
I numeri di Nvidia vanno nella stessa direzione di altri studi recenti: il modello non è tutto nella resa di un agente. A luglio, Databricks ha pubblicato ricerche che mostrano come l’harness possa impattare in modo enorme anche sui costi dell’IA.
Come ha spiegato il CEO Ali Ghodsi: con lo stesso modello e harness diversi, i costi possono raddoppiare. Pensiamo spesso in termini di “modello costoso vs. modello economico”, ma è l’harness a far esplodere o ottimizzare la spesa, oltre che la qualità.
Verso uno stack agentico aperto
Il messaggio strategico di Nvidia è semplice: un harness aperto — come i modelli open — restituisce controllo agli utenti e all’ecosistema.
- Più leve da regolare significa più accuratezza e affidabilità.
- In un momento in cui i principali laboratori rallentano l’addestramento per ragioni di sicurezza, dare agli utenti controllo su harness, infrastruttura e runtime aiuta a far progredire l’ecosistema in modo sicuro.
In sintesi: l’era degli agenti non si giocherà solo a colpi di modelli sempre più grandi. A fare la differenza saranno gli harness — la loro architettura, gli strati di supervisione, la gestione della memoria e l’orchestrazione del lavoro. È lì che si vincono i compiti a lungo raggio, ed è lì che si ottengono risultati da 100%.