IA

Actualité du 25 juillet 2026

IA - 25/07/2026

OpenWorker d'Andrew Ng : L'agent de bureau open-source qui livre des livrables finis 29

  • Date : 06/02/2026
  • Catégorie : agent IA / outil
  • Résumé technique : OpenWorker est un agent de bureau open-source (MIT) conçu pour produire des livrables concrets (documents, réponses Slack, agendas) plutôt que des conversations. L'architecture repose sur 4 couches locales : un shell Tauri 2 + React 18, un serveur Python FastAPI (port 8765), une couche de connecteurs/permissions typées, et un routeur de modèles basé sur aisuite. Il supporte 30 modèles en BYO-key (GPT-5.6, Claude Opus/Sonnet, Gemini, Ollama local) et intègre un moteur de permissions à 4 classes de risque (read, write_local, exec, external) avec 5 modes d'approbation. Les conversations et clés restent strictement locales, sans télémétrie.
  • Pourquoi c’est intéressant : Résout le problème de la "fatigue du chat" en se concentrant sur l'exécution de tâches. Le moteur de permissions typées et le mode "unattended" (suspension de la session jusqu'à réponse humaine) offrent un contrôle granulaire rare dans les agents open-source. Idéal pour les développeurs et indépendants cherchant à déployer des workflows agiques locaux, privés et auditables.
  • Angle possible pour une vidéo YouTube : J'ai testé OpenWorker : L'IA de bureau qui remplace mes logiciels (et pourquoi l'agent local va tout changer)
  • Source originale : MarkTechPost
  • URL directe :

Marker 2 : Refonte du pipeline open-source de conversion de documents 32

  • Date : 06/02/2026
  • Catégorie : outil / automatisation
  • Résumé technique : Datalab a entièrement réécrit Marker, son pipeline de parsing de documents (PDF, PPTX, DOCX, XLSX, HTML, EPUB). La v2 s'appuie sur Surya OCR 2 (modèle de layout de 20M paramètres) et un pdftext 3× plus rapide. Elle propose 3 modes : balanced (GPU, 76,0% olmOCR-bench, 2,9 pg/s), fast (CPU/MPS, léger VLM, 66,6%), et disable_ocr (CPU pur, 43,6%, 23,7 pg/s). L'architecture utilise un serveur VLM centralisé partagé par de multiples workers CPU, permettant un scaling du débit sans saturation VRAM par processus.
  • Pourquoi c’est intéressant : Détrône MinerU (5,4× plus rapide à score supérieur) et Docling (2,9 vs 2,1 pg/s et 76% vs 50,3%). Le mode CPU pur sans serveur d'inférence est un game-changer pour les déploiements edge ou low-cost. Le benchmark olmOCR-bench est livré avec un harness reproductible incluant les runners des concurrents, facilitant les tests internes avant production.
  • Angle possible pour une vidéo YouTube : Marker 2 vs Docling vs MinerU : Le nouveau roi du parsing PDF open-source ? (Benchmark réel & Workflow RAG)
  • Source originale : MarkTechPost
  • URL directe :

GPT-5.2 & GPT-5.3 Codex : OpenAI pousse l'infrastructure NVIDIA à ses limites 28

  • Date : 06/02/2026
  • Catégorie : LLM / tendance IA
  • Résumé technique : OpenAI a déployé GPT-5.2 (top sur GPQA-Diamond, AIME 2025, ARC-AGI-2) et GPT-5.3 Codex, premier modèle codant agentic capable de participer à son propre développement. Les deux sont entraînés sur NVIDIA Hopper et GB200 NVL72. GPT-5.3 fusionne coding + reasoning avec un gain de 25% de vitesse. NVIDIA souligne que le pré-entraînement reste la base de l'intelligence, avec des gains de 3× (GB200) et 4× (GB300 NVL72) sur Hopper selon MLPerf Training 5.1. Blackwell Ultra commence son déploiement cloud.
  • Pourquoi c’est intéressant : Illustre concrètement comment les lois d'échelle (pre/post-training, test-time compute) se traduisent en infra. La montée en puissance de Blackwell/GB200 explique l'accélération des cycles de développement des modèles frontier. Essentiel pour les équipes techniques et les investisseurs suivant la course au hardware AI.
  • Angle possible pour une vidéo YouTube : GPT-5.3 Codex et NVIDIA Blackwell : Comment l'IA s'entraîne vraiment (et pourquoi le matériel change la donne)
  • Source originale : NVIDIA AI Blog / OpenAI
  • URL directe :

La fin de l'hégémonie de Whisper : Panorama des nouveaux modèles open-source ASR 30

  • Date : 20/03/2026
  • Catégorie : LLM / outil / méthode
  • Résumé technique : Le leaderboard Open ASR montre une diversification majeure : Cohere Transcribe 2B (5,42% WER, Apache 2.0), IBM Granite Speech 4.1 2B (5,33%, fonctionnalités étendues : biasing, timestamps, translation), ARK-ASR-3B et MOSS-Transcribe. L'analyse révèle que le WER moyen est trompeur (jeux de données non uniformes, overfitting benchmark). Les alternatives se segmentent par usage : Parakeet TDT 0.6B (throughput 3332× RTF), Voxtral/Kyutai (streaming <500ms latence), Meta Omnilingual (1600+ langues), et diffusion-gemma-asr (approche par débruitage parallèle, recherche pure).
  • Pourquoi c’est intéressant : Fournit une matrice décisionnelle concrète pour les développeurs : plus le score ne suffit, il faut choisir selon la licence, le support streaming, la couverture linguistique ou le coût par heure audio. Guide pratique pour sortir de la dépendance Whisper et optimiser les pipelines voix→texte en production.
  • Angle possible pour une vidéo YouTube : Whisper est dépassé ? Comparatif réel des meilleurs modèles ASR open-source en 2026 (Précision, Vitesse & Streaming)
  • Source originale : MarkTechPost / Hugging Face Open ASR Leaderboard
  • URL directe :

Workflows de veille IA automatisés : Make/Zapier + Feedly Leo & NotebookLM 3436

  • Date : 05/03/2026
  • Catégorie : automatisation IA / conseil d’usage
  • Résumé technique : Stacks low-code validées pour réduire la veille manuelle de 5-10h/semaine à <1h/jour. Pipeline type : déclencheur horaire → agrégation RSS/Google Alerts → filtrage IA (Feedly Leo entraîné sur centres d'intérêt) → appel API (Claude/GPT-4) avec prompt de résumé en 3 bullet points + détection de tendances → compilation dans Gmail/Notion. Ajout optionnel de NotebookLM pour synthèse croisée hebdomadaire de rapports PDF/articles.
  • Pourquoi c’est intéressant : Méthode reproductible, sans code avancé, qui combine collecte, filtrage sémantique et synthèse hiérarchisée. Les prompts et scénarios Make sont explicitement détaillés, permettant un déploiement immédiat par les créateurs, chercheurs ou PME. Réduit drastiquement le bruit informationnel tout en conservant la validation humaine.
  • Angle possible pour une vidéo YouTube : Mon workflow de veille IA automatisé (Make + Claude + Feedly) qui me fait gagner 10h/semaine
  • Source originale : ActuIA / Silicon.fr / Tutorials communautaires
  • URL directe :