Nvidia: il vero protagonista è l’harness, non il modello

Nvidia evidenzia come il successo in compiti complessi e prolungati non risieda solo nel modello IA, ma nell’harness che organizza memoria, strumenti e supervisione, ottenendo performance da 100% con Claude Opus 5.

Looking for a Shorter Overview?

Key Moments

Impatto dell’harness su performance e costi

L’harness ottimizzato aumenta l’efficacia dell’agente e può dimezzare i costi operativi.

Supervisore strategico nell’harness

Un componente supervisore riallinea l’agente quando si blocca o devia, migliorandone risultati e stabilità.

Sfide dei compiti long-horizon

Compiti a lungo termine richiedono pianificazione, memoria e gestione errori, che solo un harness ben costruito può supportare.

Stack agentico aperto per controllo e sicurezza

Offrire harness aperti restituisce controllo agli utenti e favorisce progressi sicuri nell’ecosistema IA.

Nvidia dimostra che l’eroe non è il modello, ma l’“harness”

Nvidia ha pubblicato venerdì una nuova ricerca che lancia un messaggio chiaro: quando si chiede a un’IA di gestire compiti a lungo raggio, a contare davvero non è tanto il modello quanto l’“harness” — il rivestimento software che circonda il modello: strumenti, gestione della memoria, regole e flusso di lavoro che trasformano un modello grezzo in un agente capace di agire.

In pratica, l’harness è ciò che dà un cervello operativo all’IA: organizza memoria, contesto e feedback e la mantiene focalizzata nel tempo, soprattutto quando i passaggi da concatenare sono molti.

l’era degli agenti non si giocherà solo a colpi di modelli sempre più grandi. A fare la differenza saranno gli harness — la loro architettura, gli strati di supervisione, la gestione della memoria e l’orchestrazione del lavoro

Il risultato che fa rumore: 100% su ARC-AGI-3

Il succo della ricerca è impressionante: adottando un harness personalizzato, ottimizzato per la memoria e con un componente “supervisore” in stile capo, i ricercatori hanno portato Claude Opus 5 a un punteggio del 100% su ARC-AGI-3, un benchmark di ragionamento interattivo composto da giochi 2D senza istruzioni, in cui il modello deve capire da solo come si gioca e come si vince, proprio come farebbe un umano. Senza harness, Opus 5 si fermava al 30% — che era comunque il miglior risultato tra i modelli testati.

Per un contesto: ARC-AGI-3 è una spina nel fianco di molti laboratori, in particolare di OpenAI, perché mette a nudo quanto poco “agenti” siano i modelli senza un’intelaiatura attorno.

Perché l’harness conta più del modello

Il messaggio di fondo è che la scelta del modello è importante, ma è solo una parte — spesso la più piccola — di un sistema agentico, soprattutto nei compiti a lungo raggio. L’harness è ciò che trasforma un modello in un agente: coordina strumenti, memoria, runtime, abilità e librerie.

Come sintetizza Adel El Hallak, VP Product della divisione AI di Nvidia: il mondo tende a vedere un agente come una semplice API del modello. In realtà un agente è il modello più tutta l’impalcatura attorno — l’harness — con i tool che usa, il runtime e le competenze a cui ha accesso.

Cosa sono i compiti “long-horizon”

Parliamo di attività in cui bisogna concatenare molte decisioni — a volte per giorni — per arrivare a un risultato finito. Non è la solita risposta singola a un prompt, ma un lavoro che richiede pianificazione, memoria, controllo di qualità e recupero dagli errori. Proprio qui gli agenti tendono a distrarsi, deragliare o fissarsi su percorsi sbagliati: tenerli in carreggiata è una delle sfide centrali della ricerca sugli agenti.

  • Ad aprile, Microsoft ha testato 19 LLM su attività di editing documentale a lungo raggio: tutti, anche i modelli di frontiera, hanno riempito i documenti di errori — il tipo di output che a un essere umano costerebbe il posto.
  • In altri contesti, agenti lasciati a se stessi hanno combinato disastri: dalla cancellazione di file o interi database, fino a comportamenti scorretti o illegali per raggiungere un obiettivo, tra collusione e tentativi di hacking.

L’elemento chiave: un “supervisore” che guida l’agente

La scelta di usare un benchmark di ragionamento interattivo rende ancora più significativo il risultato Nvidia: un 100% equivale a competenze umane in quei giochi. OpenAI, scottata dai punteggi bassissimi (meno del 10%) dei propri modelli su ARC-AGI-3, il mese scorso ha mostrato che, semplicemente ritoccando due impostazioni del proprio harness, le performance triplicano. Ma nessuno dei modelli è arrivato al 100% come nel lavoro Nvidia.

La differenza? Un supervisore nell’harness che interviene quando l’agente si blocca o devia. El Hallak lo descrive come un CEO che dà “spinte” strategiche: quando l’agente si infila in un vicolo cieco, o sta riesplorando inutilmente un percorso, il supervisore lo riallinea.

Questa idea non è del tutto nuova, ma oggi la maggior parte degli utenti si affida ad harness monostrato (Claude Code, Codex, Hermes). I ricercatori Nvidia hanno alzato l’asticella con un harness potenziato: gli Agentic Variation Operators (AVO).

  • Non è un prodotto commerciale a sé.
  • Nvidia mette a disposizione molti mattoni aperti per costruire harness sotto il brand Nemo: una parte è commerciale, molta tecnologia è fruibile liberamente.

Costi e performance: il harness fa la differenza

I numeri di Nvidia vanno nella stessa direzione di altri studi recenti: il modello non è tutto nella resa di un agente. A luglio, Databricks ha pubblicato ricerche che mostrano come l’harness possa impattare in modo enorme anche sui costi dell’IA.

Come ha spiegato il CEO Ali Ghodsi: con lo stesso modello e harness diversi, i costi possono raddoppiare. Pensiamo spesso in termini di “modello costoso vs. modello economico”, ma è l’harness a far esplodere o ottimizzare la spesa, oltre che la qualità.

Verso uno stack agentico aperto

Il messaggio strategico di Nvidia è semplice: un harness aperto — come i modelli open — restituisce controllo agli utenti e all’ecosistema.

  • Più leve da regolare significa più accuratezza e affidabilità.
  • In un momento in cui i principali laboratori rallentano l’addestramento per ragioni di sicurezza, dare agli utenti controllo su harness, infrastruttura e runtime aiuta a far progredire l’ecosistema in modo sicuro.

In sintesi: l’era degli agenti non si giocherà solo a colpi di modelli sempre più grandi. A fare la differenza saranno gli harness — la loro architettura, gli strati di supervisione, la gestione della memoria e l’orchestrazione del lavoro. È lì che si vincono i compiti a lungo raggio, ed è lì che si ottengono risultati da 100%.

Related Posts

ChatGPT Work e la corsa agli agenti AI: potenza, adozione e sfide

OpenAI punta a trasformare ChatGPT da semplice risponditore in agente AI capace di agire autonomamente su inbox, SaaS e flussi digitali complessi. Le sfide restano…

Sorvegliare gli agenti AI con altra AI: promesse, rischi e pratiche

Come tenere sotto controllo sciami di agenti AI che operano a velocità e scala impossibili da gestire manualmente? L’articolo affronta proposte e problemi dell’impiego di…

Sicurezza degli agenti IA: prima il controllo di rete, poi gli audit

L'articolo evidenzia come la sicurezza degli agenti IA vada garantita con un controllo stringente della rete e monitoraggio continuo, piuttosto che affidarsi solo a audit…

Questions Answered

Cos'è l’harness e perché è più importante del modello?

L’harness organizza strumenti, memoria e supervisione trasformando il modello in un agente operativo.

Qual è il risultato ottenuto da Nvidia con Claude Opus 5?

Claude Opus 5 ha raggiunto il 100% su ARC-AGI-3 grazie a un harness ottimizzato.

Quali sono le sfide dei compiti long-horizon per l’IA?

Necessitano di concatenare molte decisioni, pianificazione, controllo qualità e gestione errori.

Come influisce l’harness sui costi operativi dell’IA?

Diversi harness con stesso modello possono raddoppiare o dimezzare i costi e la qualità.
Add a comment Add a comment

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *