| Dimanche · 24 mai 2026 |
Issue № 006 |
15 min de lecture |
|
|
La lettre hebdo FindSkill
The Skill
Réservé aux membres FindSkill Pro. L'actu IA qui compte vraiment pour ton travail.
|
|
Réservé aux membres Pro
|
Une lettre privée
|
Publié nulle part ailleurs
|
|
|
|
Mia
Éditrice apprentissage IA · FindSkill.ai
|
Bienvenue dans le numéro 006.
C'est Mia. Lundi de Pentecôte, tu lis sans doute ça en peignoir. Très bien, c'est exactement comme ça que je voulais qu'on démarre la semaine. Pas de réu de 9 h, pas de Slack qui pète, juste toi, un café, et la lettre qui te raconte ce que la semaine d'actu IA veut vraiment dire pour ton boulot. Réservé aux membres Pro. Publié nulle part ailleurs.
Mardi, Google a sorti sa stack agentique complète à I/O. Le dimanche d'avant, Anthropic a racheté la boîte qui construit les SDK de tous les grands labos. Ces deux trucs vont faire du bruit dans la presse tech pendant quinze jours. L'histoire plus calme en dessous, c'est celle sur laquelle je veux passer du temps dans ce numéro. Les fournisseurs se mettent à vendre l'évaluation comme un produit : ils publient le benchmark, puis ils te vendent le conseil pour cocher la case. OpenAI l'a fait deux fois ce mois-ci. Anthropic l'a fait avec Outcomes. HubSpot l'a fait avec AEO Sensor. Et en France, on a un acteur qui faisait déjà ça en 2021, j'y reviens en Story 3. Le pattern, c'est la nouvelle forme du go-to-market IA, et il change la tête que ton job va avoir au prochain trimestre.
Petit retour d'expé. La semaine dernière, je t'avais demandé sur quel livrable hebdo tu allais tester la boucle à deux agents en premier. 31 réponses. Le top 3 : compte-rendu client (15), mail de refus candidat (7), point d'avancement comité (5). Du coup, j'écris les grilles spécifiques au rôle pour la première fournée cette semaine, et je les renvoie à tous ceux qui ont répondu. Si tu veux la tienne dans la fournée suivante, réponds-moi.
— Mia
|
01 |
Cette semaine en IA
Trois histoires qui méritent ton attention
|
Tool Launch
Google a sorti sa stack agentique complète à I/O. La course passe de trois à quatre. Et en France, à cinq.
À Google I/O le 19 mai, Google a lancé deux trucs dans le même keynote. Gemini Spark, côté grand public : un assistant 24/7 dans l'app Gemini qui réserve des tables, remplit ton panier, retouche tes visuels à ta place. Il a shippé avec exactement trois connecteurs MCP day-one : Canva, OpenTable, Instacart. Antigravity 2.0, côté dev — une app desktop, un CLI, un SDK et des Managed Agents dans la Gemini API, tous taillés pour faire tourner plusieurs agents en parallèle. TechCrunch a titré la première vraie réponse de Google à Claude Code et Cursor. Nouveau plan AI Ultra à 100 $/mois (environ 110 € TTC en France) qui débloque 5× les quotas Antigravity du plan Pro. Côté connecteurs Spark, la liste est plus courte que la presse tech ne le laisse entendre : on a posé le décryptage samedi. Et Korben, qui est passé chez Antigravity, n'a pas mâché ses mots : « De gratuit à 275 € / mois sans prévenir » (le papier complet). Les quotas Claude Opus/Sonnet ont disparu sans email, Gemini Pro est passé de 300M à 9M tokens/semaine sans annonce. À garder en tête avant de te précipiter sur Ultra.
Côté français maintenant : Mistral avait sorti Le Chat Work Mode le 29 avril, trois semaines avant Spark. Connecteurs MCP natifs, mode agentique, exactement la même surface fonctionnelle (et Vibe pour les agents asynchrones cloud, l'équivalent de Spark). Infra européenne, RGPD natif, pricing connu d'avance. Du coup la « course à quatre » que tout le monde raconte (Claude, ChatGPT, Cursor, Gemini), en France c'est une course à cinq avec Mistral. Ignorer Le Chat dans une analyse française serait une faute pro.
|
Ce que ça signifie pour toi
Le marché des runtimes agentiques vient de passer à cinq joueurs côté FR. Pas besoin d'en choisir un cette semaine. Mais sache lequel des cinq tu utiliserais pour quel type de boulot, et écris une phrase sur chacun. C'est exactement la question que ton boss va te poser dans le mois. Passe dix minutes avec Antigravity 2.0 sur une vraie tâche cette semaine, et autant avec Le Chat Work Mode. Même si tu n'y reviens jamais, tu auras une réponse concrète quand quelqu'un te demande comment ça se compare.
|
Business
Anthropic a racheté la boîte qui construit les SDK de tous les grands labos. La couche outillage vient de se consolider.
Le 18 mai, Anthropic a racheté Stainless pour plus de 300 M$. Stainless est la startup de quatre ans qui transforme des specs API en SDK idiomatiques dans sept langages, et qui a construit les SDK officiels d'OpenAI, Google, Cloudflare, Cerebras, Perplexity, et d'Anthropic lui-même. TechCrunch a confirmé que les produits hébergés s'arrêtent pour les clients non-Anthropic. Les SDK existants continuent de tourner. La pipeline d'auto-maintenance qui les gardait synchros avec les changements d'API, non. Le thread Hacker News a tapé 527 points et s'est scindé en gros 60/40 : le côté bruyant qui crie au « supply-chain weaponization », le côté plus calme qui fait remarquer que c'est avant tout un acqui-hire de talents. Les deux lectures sont vraies. Korben a couvert avec son angle habituel (la guerre d'outillage prime sur la guerre des modèles), et Speakeasy comme FERN ont posté des offres de migration publiques en moins de 48 heures.
|
Ce que ça signifie pour toi
Même si tu ne shippes pas de SDK, ce truc compte. Le pattern qui en sort, c'est l'audit dépendances que le thread X d'@aakashgupta a sous-entendu : où ailleurs dans ta stack une seule boîte contrôle une infra dont tu dépends, et c'est quoi ton plan si elle change de cap ? Stainless est l'exemple visible. La leçon générale : savoir lequel de tes fournisseurs IA contrôle plus de la couche en dessous de toi ce trimestre que le trimestre dernier, et c'est quoi ton coût de switch s'il décide d'utiliser ce contrôle. Une heure avec ton `package.json` ou ton `requirements.txt`, et l'audit est fait. Bonus FR : l'écosystème Mistral, Hugging Face, LightOn a des alternatives sans le même risque de changement de cap. C'est exactement le moment de mettre ces noms dans le plan B.
|
Tendance en focus
L'évaluation devient un produit. Et la France l'a fait avant les Américains.
Avant d'attaquer le pattern US, parlons de Giskard. Startup parisienne fondée en 2021, 100 % dédiée à l'évaluation et au red-teaming d'agents IA (leur site, LeMagIT — « l'antivirus des agents IA »). Clients confirmés : Société Générale, Crédit Agricole, BPCE, Michelin, AXA, L'Oréal, Etam, Decathlon. Au AI Action Summit de Paris en février 2025, Giskard a annoncé Phare (Potential Harm Assessment & Risk Evaluation), un benchmark co-construit avec Google DeepMind qui évalue sept labos majeurs (OpenAI, Anthropic, Google DeepMind, Meta, Mistral, Alibaba, DeepSeek) sur hallucination, précision factuelle, biais, préjudice (le post Giskard). C'est exactement le pattern eval-as-product. Sauf qu'un acteur français l'a fait avant que OpenAI, Anthropic et HubSpot le commercialisent.
Maintenant, le pattern US. Trois datapoints de ce mois-ci, aucun n'est un hasard. Le 6 mai, OpenAI a publié B2B Signals, le rapport qui a balancé les chiffres 3,5× et 16× des « frontier firms » dans tous les decks CTO du trimestre. Quatre jours plus tard, le 10 mai, OpenAI a lancé la Deployment Company, un bras de conseil dont le pitch repose sur le fait que les entreprises se sentent en retard sur la courbe qu'OpenAI vient de publier. Anthropic a fait le pendant : Outcomes en beta publique le 6 mai aussi, une feature qui laisse les devs noter les sorties d'agent contre une grille perso et qui rapporte un gain de 10 points sur la réussite des tâches dès l'installation. Études de cas publiées dans la foulée. HubSpot a lancé AEO Sensor le 14 mai (un dashboard gratuit qui suit les citations IA) et HubSpot vend aussi les services AEO qui t'aident à réparer ce que le dashboard montre. Trois boîtes, trois semaines, même forme. Le benchmark est le funnel d'acquisition du conseil.
Côté AI Act maintenant. L'EU AI Act exige une évaluation systémique pour les systèmes haut risque (annexe III). Le Digital Omnibus du 7 mai 2026 a reporté l'application annexe III du 2 août 2026 au 2 décembre 2027 (WEnvision). Mais bon, les obligations GPAI (LLMs) restent en vigueur depuis le 2 août 2025. Bilan : l'évaluation n'est plus une best practice, c'est une obligation réglementaire en compte à rebours.
|
Ce que ça signifie pour toi
C'est le pattern à utiliser pour lire chaque annonce fournisseur des deux prochains trimestres. Quand quelqu'un publie un benchmark, demande-toi ce qu'il vend aux boîtes qui notent mal sur ce benchmark. L'info reste utile (B2B Signals est réel, le gain Outcomes de 10 points est réel, les citations d'AEO Sensor sont réelles) mais elle n'est pas neutre, et la note de bas de page sur le slide du comex n'est pas optionnelle. La version interne de ce shift compte plus que la version fournisseur. Ton équipe va se créer son moat concurrentiel l'année prochaine en construisant la grille interne en premier. La Section 03 décrit le rôle qui sort de là, la Section 04 te donne le plus petit geste possible pour démarrer.
---
|
|
02 |
Terme de la semaine
Le concept à comprendre cette semaine
|
| |
|
Terme №006
Évals
< évaluations (anglicisme assumé, le terme abrégé qu'on entend dans toutes les équipes IA) >
Une éval (anglicisme), c'est un test reproductible qui note la sortie d'une IA contre une grille. Tu définis ce que « bon » veut dire en 5–8 lignes, tu collectes un set fixe d'entrées qui comptent pour toi (un « golden set » de 20–50 exemples), tu fais tourner l'IA sur chacune, tu notes les sorties contre la grille. Tu lances ça chaque semaine et tu sais si ton IA s'améliore, se dégrade ou dérive. Petit point langue : les pros français disent « évals » à l'oral comme les devs disent « deploy ». Wikipédia traduit « évaluation », les blogs tech (Intelligence Privée, DEV.to FR sur PromptFoo) utilisent « evals » couramment. Garde le terme court, c'est ce que tu vas entendre.
|
Think of it like this →
Une prof qui écrit la grille de notation d'une dissert avant de distribuer le sujet. La grille, c'est l'éval (« La thèse apparaît-elle au premier paragraphe ? Oui / Non. Les affirmations sont-elles sourcées ? Oui / Non. »). La pile de 30 copies, c'est ton golden set. Noter de la même façon chaque semaine, c'est ce qui te dit si la classe progresse, pas ton ressenti sur la dernière copie que tu as corrigée.
|
|
⚠ Common misconception
« Les évals, c'est pour les labos qui benchmarkent les nouveaux modèles, c'est pas pour quelqu'un comme moi. » Faux. Les leaderboards type MMLU et SWE-bench sont un tout petit coin du sujet. L'éval qui compte pour ton job, c'est l'éval interne : cinq lignes concrètes qui notent la sortie IA dont tu dépends chaque semaine. Les labos utilisent des grilles parce que les grilles marchent, et la même logique tient pour un·e marketeur·euse qui note des drafts d'email ou un·e juriste qui note des notes de recherche. Construire la grille, c'est la compétence. Et elle marche à toutes les échelles, jusqu'à une seule tâche qui revient.
|
Où tu vas l'entendre: Anthropic Outcomes (notation par grille au moment de l'inférence, 6 mai). La plateforme Evals d'OpenAI (et PromptFoo, racheté par OpenAI en mars, toujours MIT). Braintrust, la plateforme d'observabilité orientée éval qui a levé 80 M$ en série B en février. Giskard, la lib open-source française qui couvre exactement ce périmètre, plus la plateforme commerciale. Inspect AI, le framework éval open-source du gouvernement UK, désormais utilisé par Anthropic et DeepMind sur les travaux de sécurité frontière. Et chaque réunion hebdo où quelqu'un dit « avant l'IA était bonne là-dessus et maintenant non » : ce qu'il veut dire, c'est on n'a pas d'éval, donc on s'en aperçoit trop tard.
Evaluating AI Models — le cours praticien →
|
|
03 |
Analyse approfondie
Le poste que personne ne recrute encore — et celui vers lequel ta carrière pointe
|
Un intitulé de poste a commencé à apparaître sur LinkedIn FR ces 90 derniers jours, et quasi personne dans ton équipe ne l'a sur son CV. Le rôle existe à cause du shift de la Section 01 Story 3, et tu peux te positionner dessus sans changer de boîte.
Première fois que j'ai vu une annonce senior pour « AI Evaluation Engineer » plafonnée à 400 K$ aux États-Unis, j'ai cru à un outlier. En fait, pas du tout. Aujourd'hui sur ZipRecruiter et Indeed, les annonces « AI Evaluator » remplissent toute la première page, avec des taux de 43 à 153 $/heure pour la version ingénieur et un salaire moyen de 65 K$ pour la version généraliste. Un autre intitulé, encore plus récent (« Agent Task Evaluator ») paie 80-130 $/heure en mai 2026. Côté France, le titre n'est pas encore standardisé, mais on voit émerger trois patterns : « Ingénieur en évaluation IA » ou « Quality Engineer IA » (le plus proche, fourchettes 70-100 K€ confirmé, 100-120 K€ senior LLM/MLOps à Paris selon Talma et Jedha) ; « AI Red Teamer » (Giskard recrute, les banques recrutent, fourchettes 45-70 K€ junior, 70-100 K€ confirmé) ; et « Évaluateur IA » côté data-labeling, à éviter, c'est l'autre métier. Le rôle n'est pas bottlenecké par les diplômes d'info, il est bottlenecké par le jugement de grille. Bonne nouvelle : le jugement de grille, c'est avant tout une compétence portable qui se construit avec la pratique, pas un diplôme à aller chercher en école.
The role. Appelons-le l'évaluateur IA : la personne dans l'équipe dont le job, c'est de savoir si la sortie IA est vraiment bonne. Iel ne rédige pas les prompts (tout le monde le fait maintenant). Iel n'entraîne pas le modèle (c'est le labo). Iel construit la grille, la fait tourner chaque semaine contre un set fixe d'exemples, audite les cas où la grille est limite, et dit à l'équipe « c'est assez bon pour partir » ou « non, et voilà exactement quel critère a sauté ». Le constat « frontier firms » de B2B Signals (64 % du gap de productivité, c'est la profondeur, pas le volume) est la maths porteuse en dessous du rôle. Une équipe qui fait tourner des milliers de workflows agentiques par semaine n'a aucun moyen de savoir lesquels marchent sans quelqu'un dont c'est précisément le job.
The skill stack. Quatre compétences, dans l'ordre du ROI. Une. Design de grille. Transforme le « est-ce que c'est bon ? » flou en 5-8 lignes concrètes, chacune une question oui/non qu'un inconnu noterait comme toi. (« Nomme la deadline » bat « est clair ».) Deux. Curation du golden set. Choisis les 20-50 entrées qui représentent la diversité des cas réels. Exemple ennuyeux, cas limite bizarre, celui qui a planté le trimestre dernier. Trois. Notation calibrée. Sache quand un LLM-juge suffit (critères objectifs, faible enjeu) et quand seul un humain captera le plantage (ton, jugement, tout ce qui est régulé). Quatre. Ops d'éval. Fais tourner le harness à la même cadence chaque semaine. Suis la dérive. Mets la grille à la retraite quand elle arrête de capter, écris-en une nouvelle. La moitié, c'est du jugement éditorial. L'autre moitié, c'est de la discipline d'opérations. Aucune des deux n'est du « machine learning ».
How to position. Trois gestes concrets qui marchent que tu sois marketeur·euse, prof, juriste ou dev. Un. Choisis la tâche IA que tu refais le plus souvent parce que la sortie revient mal. C'est la tâche avec le plus gros ROI sur une grille. Deux. Écris la grille cette semaine, cinq à huit lignes, et utilise-la pendant deux semaines. Fais-la tourner sur les vraies sorties. Resserre. Du coup, tu as un artefact qui marche que tu n'avais pas dix jours avant. Trois. Rends-le visible. Un post blog court, une page wiki interne, un Loom où tu notes deux sorties contre la grille. L'artefact, c'est ce qui rend la compétence portable. La grille dans ta tête est invisible, celle dans un doc, c'est ta ligne de CV. La réponse la plus forte en entretien dans six mois, ce n'est pas « je prompt-engineer ». C'est « j'évalue les sorties IA chez $current_company contre la grille que j'ai construite, la voici ».
Fais-le cette semaine Choisis la tâche IA hebdo que tu relances le plus souvent parce que la première sortie n'était pas bonne. Ouvre un doc vierge. Écris cinq lignes, chacune un critère oui/non que la sortie doit cocher. Fais-la tourner sur la sortie de cette semaine. Note la ligne sur laquelle l'IA a échoué. Cette note, c'est la première révision de la grille et le premier truc que tu montres en entretien sur les évals. |
|
04 |
Le workflow
Une façon d'utiliser l'IA au boulot cette semaine
|
| |
Arrête de refaire les prompts. Commence à les noter.
Prends la tâche IA que tu relances le plus souvent dans une semaine normale : le compte-rendu client hebdo, le mail de refus candidat, la note de préparation de réunion, la réécriture du mail à froid. Ouvre un doc vierge et écris une grille de cinq lignes pour cette tâche. Chaque ligne, c'est un critère oui/non : La sortie nomme-t-elle la demande spécifique du client ? Oui / Non. Cite-t-elle au moins un chiffre ? Oui / Non. La question de clôture est-elle spécifique (pas « des retours ? ») ? Oui / Non. Le ton est-il à un cran maximum du dernier mail du client ? Oui / Non. La longueur est-elle sous 180 mots ? Oui / Non. Rends chaque ligne assez concrète pour qu'un inconnu la note comme toi. Ensuite, pendant une semaine, à chaque fois que tu fais tourner cette tâche, colle la grille sous la sortie IA et note oui/non. Tu ne changes pas le prompt, tu tiens un journal. Vendredi, tu verras un des deux patterns : soit la même ligne échoue à chaque fois (le prompt a un trou réparable), soit des lignes différentes échouent au hasard (ton golden set est trop petit, ajoute trois exemples). Dans les deux cas, tu sais exactement quoi faire ensuite.
Pourquoi ça marche: Le bug de fond de l'IA one-shot, ce ne sont pas les mauvais prompts. Ce sont les mauvais prompts invisibles : tu as remarqué que la sortie était mauvaise cette semaine, mais tu n'arrives pas à dire quelle partie. Cinq lignes oui/non concrètes forcent le plantage à se nommer. Une fois qu'il a un nom, tu répares le prompt avec une seule édition au lieu de trois réécritures. C'est exactement le truc que la feature Outcomes d'Anthropic applique au moment de l'inférence : la grille resserre les degrés de liberté du modèle. Toi, tu l'appliques à la main pour une tâche. La compétence se compose : la deuxième grille te prend moitié moins de temps à écrire que la première.
|
Fais-le cette semaine
Choisis la tâche aujourd'hui. Écris les cinq lignes ce soir. Fais tourner la boucle pendant une semaine entière. La compétence qui se compose, c'est le design de grille, pas la grille pour cette tâche précise. À ta deuxième grille, tu es calibré.
|
|
|
05 |
L'idée de revenus
Une façon de gagner de l'argent avec l'IA cette semaine
|
| |
| ◆ Income Idea · Play №006 |
Vends la grille de notation, pas le prompt.
Choisis un rôle que tu as déjà fait ou regardé de près : recruteur·euse, juriste, agent immo, freelance éditeur·trice, account manager, directeur·trice d'école, junior PM, conseiller·ère patrimoine. Construis un seul PDF ou une page Notion intitulé du genre « Kit de grilles pour [rôle] — note l'IA avant de l'envoyer ». Quatre choses dedans : (1) huit grilles, une par livrable IA récurrent du rôle (mail de prospection pour un recruteur, résumé de déposition pour un juriste, descriptif d'annonce pour un agent immo). Chaque grille a 5-8 critères oui/non, concrets pas génériques (« nomme la deadline » bat « est clair ») ; (2) deux exemples travaillés par grille (un qui passe, un qui rate) avec la ligne précise qui a échoué marquée ; (3) un guide d'une page « quand utiliser LLM-juge vs humain » spécifique au rôle (le travail juridique n'a pas les mêmes lignes qui demandent du jugement humain que le copy marketing) ; (4) un petit script de mise en place pour faire tourner la même grille chaque semaine dans un Google Doc, une base Notion ou une config PromptFoo gratuite. Prix entre 39 et 79 € sur Gumroad, Lemon Squeezy ou Système.io (la plateforme française, plan gratuit pour démarrer). Positionnement bête comme chou : « T'as pas besoin d'une IA plus intelligente. T'as besoin de savoir si celle que t'as est assez bonne pour partir. »
Pourquoi ça marche: Le marché crève sous les packs de prompts et ça devient moins cher chaque mois (la plupart, c'est les mêmes prompts Claude/ChatGPT repackagés). Les grilles, c'est l'inverse des prompts côté marché : c'est ce qu'on attrape quand on a déjà essayé les prompts et que la sortie cloche encore. Quasi personne ne les productise pour les non-devs. L'acheteur te paie parce que tu as fait le boulot spécifique au rôle : définir ce que « bon » veut dire pour son job — exactement la stack de compétences de la Section 03, packagée. Revenu réaliste : 500-2 500 €/mois sans audience, 2 000-6 000 €/mois si tu DM ton réseau LinkedIn dans ce rôle. La fenêtre de tir, c'est grosso modo deux trimestres avant que ça devienne une catégorie saturée. Exactement comme les packs de prompts en 2024.
|
Fais-le cette semaine
Choisis le rôle aujourd'hui. Écris les trois premières grilles ce soir, de mémoire : qu'est-ce qu'un bon mail de prospection doit faire ? Les cinq autres peuvent venir après la première vente. Liste sur Gumroad avec trois grilles et une note « more coming ». Le listing, c'est l'artefact, pas le kit.
|
|
|
06 |
The Stack
Trois outils que je teste vraiment cette semaine
|
01 |
Giskard
Plateforme française d'évaluation et red-teaming d'agents IA · Open-source Python + plan commercial · Self-hosted possible
L'outil eval à connaître côté France. Giskard est une startup parisienne fondée en 2021, 100 % dédiée à l'évaluation et au red-teaming. Lib Python open-source (environ 15 000 utilisateurs) plus plateforme commerciale lancée en 2024. Les clients confirmés font lever un sourcil : Société Générale, Crédit Agricole, BPCE, Michelin, AXA, L'Oréal, Etam, Decathlon (LeMagIT). Et le benchmark Phare qu'ils ont annoncé avec Google DeepMind au AI Action Summit de Paris en février 2025 te dit le niveau du projet. Pourquoi c'est dans cette stack : self-hosted, RGPD-compatible, et c'est l'option qui répond aux contraintes secteur régulé FR sans aller chercher du SaaS US. Si tu bosses en finance, santé ou n'importe quel secteur où on peut te demander la méthodologie d'éval, c'est ton premier essai.
|
02 |
PromptFoo
CLI open-source pour les évals de prompts et d'agents · Gratuit (MIT)
Le premier outil que j'installe sur n'importe quelle machine neuve pour ce boulot. PromptFoo est un CLI piloté par YAML : tu écris tes prompts et tes cas de test dans une config, tu lances `promptfoo eval`, tu obtiens des comparaisons côte à côte sur GPT, Claude, Gemini, DeepSeek et n'importe quel modèle local. OpenAI a racheté l'outil en mars 2026 et il reste MIT. L'usage cité couvre un quart du Fortune 500 plus l'usage interne chez OpenAI et Anthropic. La raison d'en connaître l'existence même si tu n'écris pas de code : un non-dev peut lancer `promptfoo init` contre une clé OpenAPI et avoir une éval qui tourne en dix minutes. Le premier point difficile, c'est la grille (la compétence réelle de la Section 03). Le deuxième point difficile, c'est garder le set de tests frais. PromptFoo s'occupe de tout entre les deux. Bonus FR : il y a un tutoriel complet en français sur DEV.to pour démarrer.
|
03 |
Braintrust
Plateforme d'observabilité orientée éval · Plan gratuit ; plans équipe à partir d'environ 230 € HT/mois (hébergement US)
L'option managed pour les équipes qui ne veulent pas héberger le harness elles-mêmes. Braintrust a levé 80 M$ en série B en février à une valo de 800 M$, menée par ICONIQ avec a16z, Greylock et Elad Gil. La liste clients comprend Notion, Replit, Cloudflare, Ramp, Vercel et BILL, ce qui te dit qui fait déjà tourner ça en prod. La raison d'être dans ce numéro : Braintrust fait pour les évals ce que Datadog a fait pour les métriques serveur. Tu instrumentes l'appel agent, tu ships la grille, tu obtiens un dashboard qui te dit quel prompt a régressé quand. Le plan gratuit suffit pour faire tourner ta première éval hebdo. Petit drapeau côté France : l'hébergement est US, donc à vérifier si tu manipules de la data client UE. Pour les secteurs régulés, Giskard en self-hosted reste le choix par défaut. ---
|
|
07 |
Dans FindSkill
Ce qui est nouveau pour les membres cette semaine
|
| New |
IA pour enseignants : La routine de fin d'année en 5 prompts
Huit leçons qui déroulent la routine du dimanche soir qui remplace 6-8 heures de saisie de fin d'année. Cinq prompts copier-coller, conformes RGPD, pour les appréciations de bulletin, la lettre aux parents, la liste de lecture estivale, les PPS/PAP et les mots de remerciement. Timing parfait : la lettre sort la semaine des conseils de classe et des bulletins de fin d'année. Démarrer le cours →
|
|
| New |
Gemini Spark pour Freelances
Publié le 20 mai, le lendemain de I/O. Comment intégrer Gemini Spark dans ton workflow de freelance : conforme RGPD, prêt pour l'AI Act, avec une maths du TJM qui marche pour les indépendants français. À lire en lien direct avec la Story 1. Démarrer le cours →
|
|
| New |
Claude pour Excel
Publié le 19 mai. Finance, analyse d'écarts, débogage de formules, nettoyage de données, plus la routine de vérification. Pertinent en direct avec le rôle d'évaluateur de la Story 3 — c'est exactement la routine de vérif que la section prêche, appliquée à Excel. Démarrer le cours →
|
|
|
|
Si tu écris une grille de cinq lignes cette semaine, quelle tâche IA hebdo tu notes en premier ?
Réponds avec la tâche et un brouillon de tes cinq lignes, et je te renvoie la version que j'écrirais, calibrée pour ton rôle, pas générique. Au pire, ta grille devient un des cinq exemples travaillés du guide Pro.
↵ Réponds ici
|
|
The Skill · by FindSkill.ai
|
|