Résultats de recherche et apprentissage du travail avec l'IA.
12 fiches · 38 entities · Mis à jour
Que savent réellement faire modèles et agents, et comment apprend-on à travailler avec eux ? La preuve répond à la première question, la pédagogie à la seconde, et les deux se rassemblent ici. Études empiriques, benchmarks et expériences mesurent la capacité — tandis que la conception d'un benchmark décide souvent, discrètement, de son résultat. À côté figurent des analyses de la façon dont les développeurs apprennent à diriger des agents, de l'expertise qui reste essentielle, et de l'adaptation de l'enseignement quand la génération devient bon marché. Des programmes de tutorat et des évaluations pratiques limitées dans le temps y côtoient les études. La compréhension, non le produit, prime : chaque fiche note ce qui a été testé, ce que les chiffres soutiennent, ce qui reste ouvert.
Chiffres clés
12 vidéos
MCP for Beginners · déclaré dans la source
16,8 % des messages liés au travail et 43,5 % des messages métier-spécifiques portent sur une tâche d'un autre métier
Work at the Frontier · déclaré dans la source
coût des lectures de cache de 75 %, à 0,25 $/M tokens
Communication produit d'**Anthropic** publiée le **1er septembre 2026** sur anthropic.com (~4 000 mots, six sections, 22 témoignages de partenaires d'accès anticipé). Elle annonce **Claude Fable 5.1** (disponibilité générale) et **Claude Mythos 5.1** (accès vérifié) : *le même modèle, mais avec des niveaux de garde-fous différents*.
#Claude Fable 5.1#Claude Mythos 5.1#modèle de fondation
Anthropic — communication produit publiée sur anthropic.com · sans signature individuelle.
Post X d'**Andrew Ng** du **14 août 2026** (16:29 UTC), reprise de la lettre « Dear friends » de ***The Batch* n°366** (DeepLearning.AI, même date), ~900 mots. Ng présente **The AI Engineering Skills Map** et publie **quatre compétences** tenues pour les plus importantes. **(1) Construire et déployer des applications IA** — la spécificité est nommée : *« The key difference between AI and non-AI applications is that the former has unpredictable outputs »*, d'où l'accent mis sur les *evals* et les boucles d'analyse d'erreurs. **(2) Les fondamentaux du génie logiciel**, parce que *« Understanding software fundamentals allows you to recognize what tradeoffs even exist »* — le développeur inexpérimenté échoue *« because they don't know what context to give their coding agent »*, d'où l'objectif de *« steering coding agents using the precise language of software engineering »*. **(3) L'usage des agents de codage**, dans une formulation opérationnelle : *« help the agent autonomously close loops by providing verifiers or evals »*, et *« knowing how much to intervene and how much to leave them alone »*. **(4) *Shaping the build*** : *« Given a clear spec, coding agents are rapidly improving at delivering to it. Thus, our work as engineers is shifting toward deciding what should be in the spec »*, assorti de *« Engineers should no longer expect to be given a pixel-perfect design and asked only to implement it. »* Une **note de terminologie** porte l'essentiel du cadrage : Ng parle de **compétences** d'AI engineering et **non du rôle** « AI Engineer », avec une analogie explicite — *« All developers today should know how to work with the cloud, and only a smaller number have a "Cloud engineer" title. »* L'ensemble est adossé à *« une analyse de plus de 10 000 offres d'emploi, des dizaines d'entretiens structurés avec experts, hiring managers et recruteurs, des sondages et d'autres données en ligne »*, dont **aucun résultat chiffré n'est publié** : Ng qualifie son procédé de *« informally… akin to running clustering »* et annonce une carte détaillée dans de futurs billets. Il déclare l'intérêt en avant-dernière phrase : *« DeepLearning.AI's principal focus is to help developers gain these AI engineering skills. »*
#AI Engineering Skills Map#carte des compétences#Andrew Ng
**Andrew Ng** — fondateur de **DeepLearning.AI** · general partner d'**AI Fund** · cofondateur de **Coursera** et de **Google Brain** · ancien chief scientist de Baidu. Texte signé · à la première personne · écrit *« with my team »* sans qu'aucun collaborateur soit nommé. Publié le **14 août 2026** sur X et dans ***The Batch* n°366** — même texte aux deux endroits ; préférer *The Batch* pour toute citation durable. Quatrième fiche Ng du corpus · après les lettres n°350 (24 avril) · n°352 (8 mai) et n°359 (26 juin).
Billet et rapport d'**OpenAI Economic Research** publiés le **27 juillet 2026**, premier volet de la série **Work at the Frontier**, sur une analyse de **plus de 800 000 messages d'utilisateurs américains de ChatGPT**. **Concept forgé** : le ***task crossover*** — *« work historically associated with one occupation appearing in the AI use of people in another »*. **Le chiffre-titre est double, et c'est le point que les reprises perdent** : **16,8 % des messages liés au travail** portent sur des tâches associées à un autre métier, et **43,5 % des messages spécifiques à un métier**. L'entonnoir explique l'écart : **61,5 % de l'usage est générique** (écrire, résumer, planifier — trop partagé pour valoir preuve de crossover) et écarté ; sur les **38,5 % restants**, **43,5 % tombent hors du métier** et 56,5 % *« inside **or near** »* — la borne haute est donc calculée sur une base réduite, la borne basse sur l'usage professionnel entier. **Par métier** (part des messages métier-spécifiques renvoyant à une tâche extérieure) : expérience client **77 %**, design **75 %**, RH **69 %**, juridique **56 %**, marketing **53 %**, vente **40 %**, finance **40 %**, ingénierie **28 %** — *« a majority in five of eight groups »*. **Deux directions distinctes de circulation** : le design **importe** (35,2 %) et n'**exporte** presque rien (1,7 %) ; l'ingénierie fait l'inverse (importe 18,5 %, exporte 7,4 %) ; le **marketing cumule** (importe 24,3 %, exporte **8,9 %**, la plus forte part sortante de l'échantillon). **Deux tâches figurent dans le top 3 des emprunts des sept autres groupes** : le **calcul financier** et le **dépannage technologique**. **La heatmap, absente des reprises, est l'objet le plus riche** : elle donne la distribution complète des tâches par métier d'utilisateur, et sa diagonale est renversante — l'ingénierie retient **53 %** de son propre travail quand l'expérience client n'en retient que **11 %**, les RH **10 %** et le design **12 %**. **Effet de taille** : la part hors métier passe de **18,9 %** (2-5 postes) à **16,3 %** (>100 postes) — **mais uniquement « among average users »**, OpenAI précisant que *« among the heaviest users, we do not see the same monotonic pattern »*, et concluant au conditionnel : *« AI **may be** especially useful as a generalist tool where specialist resources are scarce. »* **Statut revendiqué** : un **signal avancé**, visible *« before firms rewrite job descriptions or create new job titles »*. **Réserve structurelle** : OpenAI mesure l'usage d'OpenAI, sur les seuls utilisateurs américains de ChatGPT, et présente cette position comme un atout — *« our unique window into how the world of work is changing »*.
#OpenAI Economic Research#Work at the Frontier#task crossover
**OpenAI Economic Research** — équipe de recherche économique d'OpenAI ; la page crédite simplement *« OpenAI »* et la classe sous les tags *Economic Research* et *2026*. Le billet est la porte d'entrée d'un **rapport PDF** (`work-at-the-frontier-report.pdf`) et s'adosse à un cadre antérieur de la même équipe · l'**AI Jobs Transition Framework** · dont il reprend la thèse que de nombreux métiers vont **se réorganiser** plutôt que disparaître.
Article pédagogique du **MindStudio Team** (blog de la plateforme MindStudio, orchestration de workflows multi-modèles) expliquant les **modèles de langage par diffusion** (*Diffusion Language Models*) à travers le cas de **Diffusion Gemma**, première implémentation **open weights** de Google (2B paramètres, dérivée de Gemma 2). La thèse : là où les modèles **autorégressifs** (GPT-4, Claude, Gemma standard) génèrent le texte **token par token, de gauche à droite** (attention causale, chaque token figé une fois produit), les modèles par **diffusion** partent d'une séquence **masquée/bruitée** et la **raffinent itérativement** (diffusion masquée / *absorbing diffusion*), avec **attention bidirectionnelle** : le modèle peut **réviser n'importe quelle position à n'importe quelle étape**. Conséquences : **parallélisme** élevé (un texte de 500 tokens nécessiterait 50-100 étapes de débruitage au lieu de 500 passes séquentielles), **infilling** et **génération sous contraintes** naturels (remplissage de templates, complétion de code avec contexte environnant), et capacité de **révision intégrée**. Mais à l'échelle actuelle (2B), Diffusion Gemma **ne rivalise pas** avec les grands autorégressifs (GPT-4o, Gemini 1.5 Pro) sur le raisonnement, le suivi d'instructions et les connaissances générales : l'écart « se referme » sans être comblé. L'inspiration vient de l'image (Stable Diffusion, DALL-E ont quitté l'autorégressif il y a des années) ; reste à savoir si le principe tient pour le texte. Diffusion Gemma est distribuée sur Hugging Face (Google DeepMind), AI Studio et Vertex AI.
#modèles de langage par diffusion#Diffusion Gemma#Google DeepMind
Étude Wharton (Generative AI Labs) : les personas experts n'améliorent pas la précision factuelle des LLM - benchmarks GPQA Diamond et MMLU-Pro - SSRN
#prompting IA#personas#précision des LLM
Savir Basil · Ina Shapiro · Dan Shapiro · Ethan Mollick · Lilach Mollick · Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)