| Domenica · 24 maggio 2026 |
Issue № 006 |
15 min di lettura |
|
|
Il brief settimanale FindSkill
The Skill
Solo per i membri di FindSkill Pro. Le notizie AI che contano davvero per il tuo lavoro.
|
|
Solo per membri Pro
|
Un brief privato
|
Non pubblicato altrove
|
|
|
|
Mia
Redattrice apprendimento IA · FindSkill.ai
|
Benvenuto al numero 006.
Sono Mia. Ogni lunedì arrivo nella tua casella e ti racconto cosa significa davvero la settimana di notizie sull'IA per come lavori: senza gergo, senza hype, senza l'energia da "10 cose che DEVI sapere". Solo per i membri Pro. Non lo pubblico da nessun'altra parte.
Martedì Google ha spedito uno stack agentico completo a I/O. La domenica prima Anthropic aveva comprato l'azienda che scrive l'SDK di ogni grande laboratorio. Sono due notizie rumorose e domineranno la stampa di settore per due settimane. La storia più silenziosa, sotto, è quella su cui voglio passare gran parte del numero. I vendor stanno iniziando a spedire la valutazione come prodotto: pubblicano il benchmark, poi vendono la consulenza che ti serve per centrarlo. OpenAI l'ha fatto due volte questo mese. Anthropic l'ha fatto con Outcomes. HubSpot con AEO Sensor. È la nuova forma del go-to-market dell'IA, e in Italia pesa anche di più: dal 2 agosto la valutazione di conformità diventa obbligo di legge.
Una nota sulle risposte. La domanda della settimana scorsa — su quale deliverable settimanale costruisci per primo il loop a due agenti — ha raccolto 31 risposte. Le prime tre: aggiornamenti settimanali al cliente (15), lettere di rifiuto candidati (7), update al consiglio di amministrazione (5). Questa settimana sto scrivendo le rubriche specifiche per ciascun ruolo del primo gruppo, e arrivano a chi ha risposto. Rispondi anche tu se vuoi la tua nel prossimo giro.
— Mia
|
01 |
Questa settimana in IA
Tre storie che meritano la tua attenzione
|
Tool Launch
Google ha spedito lo stack agentico completo a I/O. I runtime sono passati da tre a quattro.
A Google I/O del 19 maggio, Google ha lanciato due cose in un solo keynote. Gemini Spark è il lato consumer: un agente personale 24/7 dentro l'app Gemini che prenota tavoli, riempie carrelli e ritocca le immagini al posto tuo. È uscito con esattamente tre connettori MCP al day one: Canva, OpenTable, Instacart. Antigravity 2.0 è il lato developer: app desktop standalone, CLI, SDK e Managed Agents dentro la Gemini API, tutto pensato per far girare tanti agenti in parallelo. Il pezzo di TechCrunch l'ha definita la prima vera risposta di Google a Claude Code e Cursor. C'è anche un nuovo piano AI Ultra da 100 $/mese (circa 90 €) che alza di 5× i limiti d'uso di Antigravity rispetto al Pro: fuori scala per il professionista italiano medio, e ogni testata tech italiana l'ha sottolineato. La lista di connettori di Spark è più corta di quanto la stampa di settore lasci intendere: ne ho parlato sabato costruendo l'albero decisionale per chi fa SaaS-PM. E il Sole 24 Ore l'ha letta bene: dopo anni di rincorsa, Google "ora mostra l'ecosistema più maturo e coerente". Disponibilità italiana di Spark: non confermata, finestra Europa "qualche mese".
Mentre Google spinge il runtime sul consumer con tre connettori, in Italia esistono già piattaforme agentiche sovrane in produzione. Almawave ha rilasciato Velvet 25B a ottobre 2025 (ottimizzato sulle 24 lingue UE) e a luglio 2025 è stata tra le prime al mondo a ottenere ISO/IEC 42001, la certificazione per i sistemi di gestione dell'IA. Domyn (ex iGenius, primo unicorno AI italiano del 2025) ha raccolto circa 650 milioni di euro per Colosseum 355B con NVIDIA, modello sovrano per banche, assicurazioni, PA. Spark è il consumer player. Almawave e Domyn sono già il player enterprise regolato. La domanda non è "quale uso io". È "quale userà la mia banca, il mio Comune, la mia ASL".
|
Cosa significa per te
Il mercato dei runtime agentici è una corsa a quattro cavalli. Claude, ChatGPT, Cursor e adesso Gemini hanno tutti uno stack multi-agente in produzione per utenti reali. Non devi sceglierne uno questa settimana. Devi sapere quale dei quattro useresti per quale tipo di lavoro, e idealmente scrivere una frase su ciascuno: è la domanda che il tuo responsabile ti farà nel prossimo mese. Dedica dieci minuti ad Antigravity 2.0 su un task vero. Anche se non lo riapri più, hai una risposta concreta quando qualcuno ti chiede come si posiziona.
|
Business
Anthropic ha comprato chi ha scritto l'SDK di ogni grande laboratorio. E la settimana dopo apre Milano.
Il 18 maggio Anthropic ha acquisito Stainless per più di 300 milioni di dollari. Stainless è la startup di quattro anni che trasforma le specifiche API in SDK idiomatici in sette linguaggi, e ha costruito gli SDK ufficiali di OpenAI, Google, Cloudflare, Cerebras, Perplexity e della stessa Anthropic. TechCrunch ha confermato che i prodotti hosted vengono spenti per i clienti non-Anthropic. Gli SDK esistenti continuano a funzionare; la pipeline di auto-manutenzione che li teneva sincronizzati con le modifiche API no. Il thread su Hacker News ha fatto 527 punti e si è spaccato 60/40: la parte più rumorosa parla di "weaponizzazione della supply chain", quella più silenziosa nota che l'acquihire dei talenti è la vera mossa. Tom's Hardware Italia ha titolato "Anthropic compra Stainless, e chiude un rubinetto per i rivali". Speakeasy e FERN hanno pubblicato offerte di migrazione per gli ex clienti Stainless entro 48 ore.
E qui la storia raddoppia, per il lettore italiano: il 28 maggio, tre giorni dopo questo numero, Anthropic apre il suo sesto ufficio europeo a Milano. Tra i clienti italiani citati: Bending Spoons, Satispay, Generali, Unipol, Jakala, BCG. Letta da sola, Stainless è una notizia infrastrutturale. Letta insieme a Milano, è una mossa: compra l'SDK lunedì, apre l'ufficio commerciale la settimana dopo. Anthropic consolida il layer sotto agli sviluppatori proprio mentre porta la macchina di vendita nel mercato italiano regolato — banche, assicurazioni, fintech. I builder italiani che già integrano Claude con TeamSystem, Zucchetti o Fatture in Cloud via MCP ne beneficiano direttamente; chi gira su OpenAI o Google dovrà rifare il setup degli SDK quando i contratti Stainless scadono.
|
Cosa significa per te
Anche se non spedisci un SDK, questa storia ti riguarda. La lezione è l'audit del grafo delle dipendenze che il thread di @aakashgupta su X lasciava intendere: dove altro nel tuo stack una sola azienda controlla l'infrastruttura da cui dipendi, e qual è il tuo piano se quell'azienda cambia rotta? Stainless è l'esempio visibile. La lezione generale è sapere quale dei tuoi vendor AI possiede più del layer sotto di loro rispetto al trimestre scorso, e qual è il tuo costo di switch se decidono di esercitare quel controllo. Un'ora con il tuo `package.json` o `requirements.txt` è l'audit. E se la tua azienda ha clienti citati nel pitch deck Milano di Anthropic, la conversazione con il commerciale Anthropic arriva nel prossimo trimestre: meglio avere già l'audit fatto.
|
Tendenza sotto i riflettori
I vendor pubblicano il benchmark e vendono i servizi per centrarlo. La valutazione sta diventando un prodotto. E in Italia, dal 2 agosto, diventa una legge.
Tre dati di questo mese, nessuno casuale. Il 6 maggio OpenAI ha pubblicato B2B Signals, il report che ha portato i numeri "3,5×" e "16×" sulle frontier firms in ogni slide CTO del trimestre. Quattro giorni dopo, il 10 maggio, OpenAI ha lanciato la Deployment Company, un braccio consulenziale il cui pitch deck dipende dal fatto che le aziende si sentano in ritardo proprio sul grafico che OpenAI ha appena pubblicato. Anthropic ha giocato in parallelo: lo stesso 6 maggio ha portato Outcomes in beta pubblica, una funzionalità che fa valutare l'output di un agente contro una rubrica custom e che ha portato 10 punti di miglioramento sul task success appena attivata. Hanno pubblicato anche i case study. HubSpot ha lanciato AEO Sensor il 14 maggio: una dashboard gratuita che traccia le citazioni nella ricerca IA, e in parallelo vende i servizi AEO per sistemare quello che la dashboard mostra. Tre aziende, tre settimane, stessa forma. Il benchmark è il funnel della consulenza.
In Italia questo non è marketing dei vendor. È AgID. La Legge 132/2025 (in vigore dal 10 ottobre 2025) designa AgID come responsabile delle notifiche: accredita e monitora gli organismi che valutano la conformità dei sistemi AI. Il 2 agosto 2026 entra in vigore la fase sanzionatoria dell'AI Act: obblighi per i sistemi ad alto rischio, autorità di vigilanza nazionali (ACN), valutazioni di conformità obbligatorie. Il costo di mercato di una valutazione di conformità va dai 5.000 ai 50.000 € a sistema, e un assessment consulenziale iniziale fra i 10.000 e i 25.000 €. Almawave è già il caso scuola italiano del pattern OpenAI: pubblica Velvet (settimo nei modelli AI fino a 20 miliardi di parametri, batte IBM e NVIDIA sui benchmark in italiano), vende l'implementazione enterprise e PA. Tra sei mesi ogni grande consulente italiano (Reply, Engineering, Accenture Italia, PwC Italia, Deloitte Italia) farà la stessa mossa.
|
Cosa significa per te
Questo è il pattern con cui leggere ogni annuncio dei vendor nei prossimi due trimestri. Quando qualcuno pubblica un benchmark, chiediti cosa vende alle aziende che ci fanno punteggio basso. L'informazione è comunque utile (B2B Signals è reale, i 10 punti di Outcomes sono reali, le citazioni di AEO Sensor sono reali) ma non è neutrale, e la nota a piè di pagina sulla slide del board non è opzionale. La versione interna di questo spostamento conta più di quella dei vendor. Il fossato competitivo della tua squadra nel prossimo anno sarà chi costruisce per primo la rubrica interna. La Sezione 03 è il ruolo che ne nasce; la Sezione 04 è la mossa più piccola possibile per cominciare.
---
|
|
02 |
Termine della settimana
Il concetto da capire questa settimana
|
| |
|
Termine №006
Eval (valutazione)
< evals, eval harness, rubrica di valutazione, valutazione di conformità >
Un eval è un test ripetibile che assegna un voto all'output di un'IA contro una rubrica. La pubblica amministrazione italiana lo chiama "valutazione di conformità", la community tech lo chiama "eval", la scuola lo chiama "rubrica". È la stessa cosa. Definisci come si presenta "buono" in 5–8 righe, raccogli un insieme fisso di input che ti interessano (un "golden set" di 20–50 esempi), fai girare l'IA su ciascuno e valuti gli output contro la rubrica. Ripeti il giro ogni settimana e sai se la tua IA sta migliorando, peggiorando o derivando.
|
Pensaci così →
Un insegnante che scrive la rubrica di valutazione per un tema prima di consegnare la traccia. La rubrica è l'eval ("La tesi compare nel primo capoverso? Sì / No. Le affermazioni hanno fonti? Sì / No"). La pila di 30 temi è il tuo golden set. Valutare allo stesso modo ogni settimana è quello che ti dice se la classe sta migliorando, non la sensazione che hai avuto correggendo l'ultimo tema. Le nuove Indicazioni Nazionali dei licei sull'IA hanno appena messo le "rubriche di valutazione" come standard didattico: il vocabolario è già in casa, non te lo devi importare.
|
|
⚠ Common misconception
"Le eval sono per i laboratori AI che fanno benchmark sui nuovi modelli, non sono cose per uno come me." No. Le eval delle leaderboard tipo MMLU e SWE-bench sono un angolino del campo. L'eval che conta nel tuo lavoro è quella interna: cinque righe concrete che valutano l'output IA da cui dipendi ogni settimana. I laboratori usano rubriche perché le rubriche funzionano; la stessa logica vale per un marketer che valuta bozze di email o un commercialista che valuta una pre-revisione di bilancio. Il design della rubrica è la competenza, e scala fino a un singolo task ripetuto.
|
Dove lo sentirai: Anthropic Outcomes (rubric-grading al momento dell'inferenza, 6 maggio). Platform OpenAI Evals (e PromptFoo, che OpenAI ha acquisito a marzo: rimane MIT). Braintrust, la piattaforma di osservabilità eval-first che ha chiuso un Series B da 80 milioni di dollari a febbraio. Inspect AI, il framework open-source del governo britannico ora usato da Anthropic e DeepMind per i lavori di frontier-safety. In Italia il termine arriva da due direzioni: dal lato tech (ai4Business, Tom's Hardware Italia, consulenti su Claude tipo Pasquale Pillitteri) e dal lato regolatorio (linee guida AgID, "valutazione di conformità" come obbligo dell'AI Act dal 2 agosto). E ogni riunione settimanale in cui qualcuno dice "l'IA prima era brava in questa cosa e adesso non più" significa non abbiamo un eval, quindi ce ne siamo accorti tardi.
Evaluating AI Models — il corso pratico →
|
|
03 |
Analisi profonda
Il ruolo che AgID sta costruendo — e la traiettoria di carriera che ci porta dentro
|
C'è un titolo professionale che negli ultimi 90 giorni è apparso su ZipRecruiter e Indeed e che quasi nessuno nella tua squadra ha sul curriculum. In Italia non lo trovi ancora su LinkedIn: è esattamente per questo che lo spazio esiste. Il 2 agosto 2026 entra in vigore la fase sanzionatoria dell'AI Act, AgID ha già designato gli organismi notificati che valuteranno i sistemi ad alto rischio, e la professione sta letteralmente nascendo per decreto.
Negli Stati Uniti i job posting per "AI Evaluation Engineer" pagano fino a 153 $/h (ZipRecruiter) e un secondo titolo, ancora più nuovo, "Agent Task Evaluator", paga 80–130 $/h a maggio 2026. In Italia il ruolo non si trova su Glassdoor IT né su LinkedIn IT. Non perché non serva: perché l'obbligo di legge arriva ad agosto e nessuno l'ha ancora prezzato. La maggior parte degli ingegneri AI italiani sta tra 32.000 € lordi/anno (junior) e 85.000 € (senior LLM/GenAI), un AI Product Manager intorno ai 75.000 €. Il ruolo che cresce, secondo LinkedIn 2026, è quello che "garantisce governance, etica, trasparenza e conformità all'AI Act europeo". Non è bloccato da credenziali in informatica. È bloccato dal giudizio sulla rubrica. Buona notizia, perché il giudizio sulla rubrica è in larga parte una competenza portatile che si rafforza con la pratica, non un pezzo di carta per cui devi tornare in università.
The role. Chiamalo valutatore AI: la persona in una squadra il cui mestiere è sapere se l'output dell'IA è davvero buono. Non scrive i prompt (lo fanno tutti adesso). Non addestra il modello (lo fa il laboratorio). Costruisce la rubrica, la fa girare ogni settimana contro un insieme fisso di esempi, fa audit sui campioni dove la rubrica è al limite, e dice alla squadra "questa cosa è abbastanza buona da spedire" o "no, ed ecco esattamente quale criterio è fallito". Il dato di B2B Signals (il 64% del divario di produttività delle frontier firms è profondità, non volume) è la matematica portante sotto al ruolo. Una squadra che fa girare migliaia di workflow agentici a settimana non ha modo di sapere quali funzionano senza qualcuno il cui mestiere sia esattamente questo. In Italia il titolo arriva in due forme parallele: AI Governance Specialist dentro le aziende (Reply, Engineering, Capgemini Italia, Accenture Italia, PwC Italia, Deloitte Italia stanno già aprendo le practice), e Auditor AI / Valutatore di Conformità dentro gli organismi notificati che AgID sta accreditando (SGS, DNV, TÜV, Bureau Veritas: DNV ha già firmato la prima ISO/IEC 42001 ad Almawave).
The skill stack. Quattro competenze, in ordine di rendimento. Una — design della rubrica. Trasforma la "è buono?" sfumata in 5–8 righe concrete, ognuna una domanda sì/no che un estraneo potrebbe valutare allo stesso modo in cui la valuti tu. ("Cita la scadenza" batte "è chiaro".) Due — curatela del golden set. Scegli i 20–50 input che rappresentano la varietà dei casi reali. L'esempio noioso, il caso limite strano, quello che si è rotto il trimestre scorso. Tre — valutazione calibrata. Sapere quando va bene un LLM-come-giudice (criteri oggettivi, basso rischio) e quando solo un umano coglie il fallimento (tono, giudizio, qualsiasi cosa regolata). Quattro — eval ops. Fai girare il harness alla stessa cadenza ogni settimana. Tieni traccia del drift. Manda in pensione la rubrica quando smette di pescare cose e ne scrivi una nuova. Metà di questo è giudizio editoriale; l'altra metà è disciplina operativa. Nessuna delle due metà è "machine learning".
How to position. Tre mosse concrete che funzionano se fai marketing, l'insegnante, il commercialista o l'ingegnere. Una — scegli l'unico task IA che rifai più spesso perché l'output continua a tornare sbagliato. È il task con il ROI più alto su una rubrica. Due — scrivi la rubrica questa settimana, cinque-otto righe, e usala per due settimane. Falla girare sugli output veri. Stringila. Adesso hai un artefatto funzionante che dieci giorni fa non avevi. Tre — rendila visibile. Un breve post sul blog, una pagina sul wiki interno, una registrazione Loom in cui valuti due output contro la rubrica. L'artefatto è quello che rende la competenza portatile: la rubrica nella tua testa è invisibile; quella in un documento è una riga sul curriculum. La risposta più forte a un colloquio fra sei mesi non sarà "faccio prompt engineering". Sarà "valuto gli output IA in $azienda_attuale contro la rubrica che ho costruito: eccola". Bonus italiano: se la rubrica è scritta dentro il vocabolario dell'AI Act (criteri di conformità per sistema ad alto rischio, tracciabilità delle decisioni automatizzate), vale ancora di più al colloquio in una banca, in un'assicurazione o in un organismo notificato AgID. Tariffe enterprise di riferimento: 5.000–50.000 € per una valutazione di conformità a sistema, 10.000–25.000 € per un assessment consulenziale, 20.000–80.000 € per un programma di formazione AI corporate.
Fallo questa settimana Scegli l'unico task IA settimanale che rifai più spesso perché il primo output non era giusto. Apri un documento nuovo. Scrivi cinque righe, ognuna un criterio sì/no che l'output deve centrare. Falla girare sull'output reale di questa settimana. Annota su quale riga l'IA ha fallito. Quell'annotazione è la prima revisione della rubrica e la prima cosa che mostreresti in un colloquio sulla valutazione AI. |
|
04 |
Il flusso
Un modo per usare l'IA al lavoro questa settimana
|
| |
Smetti di rifare i prompt. Inizia a valutarli.
Scegli il task IA che rifai più spesso in una settimana normale: l'aggiornamento settimanale al cliente, la lettera di rifiuto al candidato, il brief di preparazione alla riunione, la riscrittura della cold email. Apri un documento nuovo e scrivi una rubrica da cinque righe. Ogni riga è un criterio sì/no: L'output cita la richiesta specifica del cliente? Sì / No. Cita almeno un dato concreto? Sì / No. La domanda di chiusura è specifica (non "pareri?")? Sì / No. Il tono è entro un registro dall'ultima email del cliente? Sì / No. La lunghezza è sotto le 180 parole? Sì / No. Rendi ogni riga abbastanza concreta che un estraneo la valuterebbe allo stesso modo in cui la valuti tu. Adesso per una settimana, ogni volta che fai girare quel task, copia la rubrica sotto all'output IA e segna sì/no. Non stai cambiando il prompt. Stai tenendo un registro. Entro venerdì vedrai uno di due pattern: o fallisce sempre la stessa riga (il prompt ha un buco fixabile), oppure falliscono righe diverse a caso (il tuo golden set è troppo piccolo e ti servono tre esempi in più). In entrambi i casi sai esattamente cosa fare dopo.
Perché funziona: Il vero punto debole dell'IA one-shot non sono i prompt scadenti. Sono i prompt scadenti invisibili: hai notato che l'output era sbagliato questa settimana ma non riesci a dire quale parte. Cinque righe sì/no concrete costringono il fallimento a dare un nome a se stesso. Una volta che ha un nome, sistemi il prompt con una modifica al posto di tre riscritture. È lo stesso trucco che la funzionalità Outcomes di Anthropic applica al momento dell'inferenza: la rubrica restringe i gradi di libertà del modello. Tu lo applichi a mano per un task. La competenza si accumula: la seconda rubrica si scrive in metà del tempo della prima.
|
Fallo questa settimana
Scegli il task oggi. Scrivi le cinque righe stasera. Fai girare il loop per una settimana piena. Bonus: la rubrica da cinque righe è la cosa da scrivere prima di scollegare per il ponte. Lunedì 1° giugno + martedì 2 (Festa della Repubblica) fanno quattro giorni di stacco con un solo giorno di ferie. Quando torni mercoledì 3, hai una settimana di output da valutare con uno standard chiaro — non ricominci da zero.
|
|
|
05 |
Idea di reddito
Un modo per guadagnare con l'IA questa settimana
|
| |
| ◆ Income Idea · Play №006 |
Vendi la rubrica, non il prompt.
Scegli un ruolo che hai fatto o visto da vicino: recruiter, commercialista, agente immobiliare, editor freelance, account manager, dirigente scolastico, junior PM, consulente finanziario. Costruisci un singolo PDF o una pagina Notion intitolata tipo "Kit rubriche per [ruolo] — valuta l'IA prima di mandarla." Dentro metti quattro cose: (1) otto rubriche, una per ogni deliverable IA ricorrente in quel ruolo (l'email di outreach del recruiter, la sintesi della deposizione del commercialista, la descrizione dell'annuncio dell'agente immobiliare); ogni rubrica è 5–8 criteri sì/no, concreti non generici ("cita la scadenza" batte "è chiaro"); (2) due esempi lavorati per rubrica, uno che passa e uno che fallisce, con la riga esatta che è fallita marcata; (3) una guida da una pagina su "quando usare un LLM-come-giudice contro un umano" specifica per quel ruolo — il lavoro del commercialista ha righe diverse che richiedono giudizio umano rispetto al copy di marketing; (4) uno script di setup breve per far girare la stessa rubrica ogni settimana in un Google Doc, in un database Notion o in una config gratuita di PromptFoo. Prezzo 39–69 € su Gumroad o Lemon Squeezy. Posizionamento secco: "Non ti serve un'IA più intelligente. Devi sapere se quella che hai è abbastanza buona da mandare."
Perché funziona: Il mercato è pieno di pacchetti di prompt che si svalutano ogni mese: la maggior parte ha gli stessi prompt Claude/ChatGPT riconfezionati. Le rubriche sono l'inverso dei prompt come posizionamento di mercato: sono quello che cerchi quando i prompt li hai già provati e l'output ancora ti puzza. Quasi nessuno le sta producendo per i non-developer. L'acquirente ti paga perché hai fatto il lavoro specifico-per-il-ruolo di capire come si presenta il "buono" per il suo mestiere: esattamente lo skill stack della Sezione 03, incartato. Ricavi realistici: 450–2.300 €/mese senza pubblico; 1.850–5.500 €/mese se lo proponi alla tua rete LinkedIn esistente in quel ruolo. Bonus italiano: con la fase sanzionatoria dell'AI Act dal 2 agosto e le valutazioni di conformità che entrano nei piani di acquisto delle PMI italiane, vendere una rubrica con i criteri già scritti e tracciabili è un argomento di vendita in più, soprattutto verso commercialisti, consulenti del lavoro e dirigenti di settori regolati (sanità, finanza, scuola). La finestra di tempo è di circa due trimestri prima che la categoria si saturi, come è successo ai pacchetti di prompt nel 2024.
|
Fallo questa settimana
Scegli il ruolo oggi. Scrivi le prime tre rubriche stasera, a memoria: cosa deve fare una buona email di outreach? Le altre cinque arrivano dopo la prima vendita. Lista su Gumroad con tre rubriche e una nota "altre in arrivo"; l'inserzione è l'artefatto, non il kit.
|
|
|
06 |
The Stack
Tre strumenti che sto testando davvero questa settimana
|
01 |
Braintrust
Piattaforma di osservabilità eval-first · Piano gratis; team da circa 249 $/mese
L'opzione managed per le squadre che non vogliono ospitare l'harness da sole. Braintrust ha chiuso un Series B da 80 milioni di dollari a febbraio su una valutazione di 800 milioni, lead ICONIQ con a16z, Greylock ed Elad Gil. La lista clienti include Notion, Replit, Cloudflare, Ramp, Vercel, BILL: ti dice chi lo sta già facendo girare in produzione. Il motivo per cui sta in questo numero: Braintrust fa per gli eval quello che Datadog ha fatto per le metriche dei server. Strumenti la chiamata all'agente, spedisci la rubrica, ottieni una dashboard che ti dice quale prompt è regredito quando. Il piano gratis basta per far girare il tuo primo eval settimanale. Vale un pomeriggio per vedere se la trace view si sposa col tuo modo di lavorare.
|
02 |
PromptFoo
CLI open-source per eval di prompt e agenti · Gratis (MIT)
Il primo strumento che installo su una macchina nuova per questo lavoro. PromptFoo è una CLI configurabile in YAML: scrivi i prompt e i test case in un file di config, lanci `promptfoo eval` e ottieni confronti affiancati su GPT, Claude, Gemini, DeepSeek e ogni modello locale. OpenAI l'ha acquisito a marzo 2026 e resta MIT; l'uso citato copre un quarto delle Fortune 500 più l'uso interno sia in OpenAI che in Anthropic. Il motivo per cui vale la pena conoscerlo anche se non scrivi codice: un non-developer può lanciare `promptfoo init` con una chiave OpenAPI e avere un eval funzionante in dieci minuti. La prima parte difficile è la rubrica (che è la vera competenza della Sezione 03). La seconda parte difficile è tenere il test set fresco. PromptFoo gestisce tutto quello che sta in mezzo.
|
03 |
Inspect AI (e una nota su AIWave per chi è in settore regolato italiano)
Framework eval open-source del governo britannico · Gratis (MIT, Python)
L'opzione seria per chiunque abbia bisogno di eval che reggano sotto controllo regolatorio. Inspect AI è stato costruito dall'UK AI Security Institute ed è ora usato da Anthropic e Google DeepMind per le valutazioni di frontier-safety. La libreria arriva con più di 200 task di valutazione pre-costruiti e gira su ogni API principale più i modelli locali. Il motivo per cui sta nello stack di questo numero: lo stile di eval che Inspect AI impone (dataset, scorer, esecuzione in sandbox, log riproducibili) è esattamente come si presenta il lavoro AI auditabile nei settori regolati. La documentazione di interoperabilità è il modo educato con cui l'UE sta segnalando che questo è il framework di cui si fideranno i compratori del settore pubblico, e gli organismi notificati che AgID sta accreditando guarderanno qui per scegliere il framework di riferimento. Nota italiana: se lavori in PA o in un settore regolato (banca, assicurazione, sanità), AIWave di Almawave — piattaforma multimodale e multi-agente già certificata ISO/IEC 42001 — è l'opzione sovrana. Costa più di PromptFoo, ma minimizza il rischio AI Act per costruzione. ---
|
|
07 |
Dentro FindSkill
Cosa c'è di nuovo per i membri questa settimana
|
| New |
IA per la Dichiarazione 730 (corso italiano) — Cinque lezioni che ti portano dal precompilato al rimborso anche se non hai mai aperto il portale dell'Agenzia delle Entrate. Pubblicato venerdì 23 maggio, super-stagionale: il 31 maggio scade il termine per ricevere il rimborso 730 in busta paga di luglio (chi salta resta fuori dal primo giro). Il 22 giugno chiude la finestra di annullamento web. Inizia il corso →
- `New` — IA per Insegnanti (corso italiano) — Giugno è il mese delle pagelle, dei giudizi finali, delle lettere ai genitori e dei programmi delle vacanze. Otto lezioni che coprono i prompt ricorrenti dell'ultimo periodo dell'anno scolastico, con esempi su scuola secondaria di primo e secondo grado, scritti per il contesto italiano (non tradotti). Inizia il corso →
- `New` — Pacchetto fisco AI (Commercialista, ISA, Superbonus, Cartelle Agenzia Entrate)
Il bundle che il commercialista o l'imprenditore italiano dovrebbe avere aperto in tab di fianco a Fatture in Cloud. Tutti e quattro in italiano, otto lezioni l'uno, certificato finale. Commercialista → · ISA → · Superbonus → · Cartelle Agenzia Entrate →
|
|
|
|
| New |
/learn/ambient-ai/
Lo spiegone in profondità Investopedia per il termine che è apparso in ogni keynote di questo mese. Cosa è davvero l'ambient AI, perché il lancio di Spark di Google è la sua prima vera superficie consumer, e i tre corsi FindSkill che ci mappano sopra. Leggi la pagina →
|
|
|
|
Se questa settimana scrivi una rubrica da cinque righe, su quale task IA settimanale la fai girare per prima?
Rispondi con il task e uno schizzo delle tue cinque righe e ti rimando indietro la versione che avrei scritto io — calibrata per il tuo ruolo, non generica. Nel peggiore dei casi, la tua rubrica diventa uno dei cinque esempi lavorati nella guida Pro. E se mandi prima del ponte della Festa della Repubblica, torni mercoledì 3 giugno con la tua versione già pronta.
↵ Rispondi
|
|
The Skill · by FindSkill.ai
|
|