IA - 26/08/2026
Perplexity Portable Computer : Agent IA entièrement local avec escalade cloud contrôlée
- Date : 25/08/2026
- Catégorie : agent IA / automatisation / outil
- Résumé technique : Perplexity a publié Portable Computer, une version local-first de sa plateforme agentic qui exécute le harness d'agent, l'orchestrateur, le planificateur, le routeur d'outils et les modèles post-entraînés directement sur NVIDIA DGX Spark. Chaque tâche démarre sur l'appareil ; l'exécution des outils est sandboxée par le système d'exploitation. Si une étape nécessite le web en direct ou un raisonnement frontier, l'orchestrateur s'arrête, applique un classificateur PII, affiche explicitement ce qui quittera la machine, et n'envoie que cette étape vers l'un des 15+ modèles cloud après approbation utilisateur. Le système utilise Qwen 3.8 27B (quantisé à 3 bits) ou le variant post-entraîné PPLX 27B, avec une gestion contextuelle optimisée pour contourner les limites de fenêtre des petits modèles 30.
- Pourquoi c’est intéressant : C'est la première plateforme agentic commerciale qui sépare clairement l'exécution locale (zéro coût par token) de l'escalade cloud sur demande explicite, résolvant le dilemme confidentialité/performance pour les secteurs réglementés. Les benchmarks internes montrent 85,4% de réussite sur un banc de 53 tâches professionnelles avec PPLX 27B, surpassant les harness Pi et Hermes identiques, et une réduction de 70% des tokens consommés grâce à l'orchestration locale 30.
- Angle possible pour une vidéo YouTube : "Fin du cloud inconditionnel ? Comment Perplexity Portable Computer fait tourner un agent IA pro en local avec escalation sécurisée (test DGX Spark vs Cloud)"
- Source originale : MarkTechPost / NVIDIA Local AI Blog
- URL directe :
AWS Kiro + GPT-5.6 : Workflow de développement spec-driven avec réduction des coûts à 82%
- Date : 24/08/2026
- Catégorie : workflow IA / automatisation / outil développeur
- Résumé technique : OpenAI a intégré sa famille GPT-5.6 (Sol, Terra, Luna) dans Kiro, l'environnement de développement spec-driven d'AWS. Kiro transforme les intents bruts en documents de spécification, plans techniques et listes de tâches exécutables avant génération de code, puis valide les sorties via des tests property-based. Sur Terminal-Bench 2.1, cette architecture contextuelle a permis à GPT-5.6 Terra d'atteindre le même niveau de réussite qu'en prompt direct mais avec environ 82% de réduction des coûts par tâche terminée, grâce à moins d'itérations et de tokens gaspillés 34.
- Pourquoi c’est intéressant : Cela valide concrètement que l'ajout d'une couche de spécification et de scaffolding technique avant la génération code réduit drastiquement la consommation d'API sans sacrifier l'exactitude. Pour les équipes dev, cela signifie passer de l'IA "vibe coding" fragile à un pipeline reproductible, gouverné et économiquement viable en production 34.
- Angle possible pour une vidéo YouTube : "-82% de coûts OpenAI avec Kiro ? Pourquoi la spec-driven AI est le futur du dev (GPT-5.6 vs prompt brut)"
- Source originale : Unite.ai / AWS News Center
- URL directe :
Fastino GLiNER 2.5 : Extraction d'entités à frontière prédictive, CPU-runnable et multi-tâches
- Date : 24/08/2026
- Catégorie : LLM / automatisation / méthode
- Résumé technique : Fastino a publié GLiNER2.5, qui remplace l'énumération de spans par la prédiction directe des bornes d'entités (start/end scores + inside tokens). Cette architecture élimine le plafond de largeur d'entité, autorise un contexte de 4 096 mots et maintient une complexité linéaire. Le modèle décode conjointement entités, relations et attributs via un beam search contraint, garantissant la validité structurelle sans validation post-hoc. Trois checkpoints Apache 2.0 (74M, 194M, 287M) sont CPU-runnables sous Linux/macOS/Windows 32.
- Pourquoi c’est intéressant : Résout le goulot d'étranglement des LLM lourds pour l'extraction documentaire tout en surpassant les encodeurs rigides. Idéal pour automatiser la détection de PII, l'extraction de clauses contractuelles ou la construction de graphes de connaissances agent-ready sans budget GPU. Le modèle monte à 56,17 macro-F1 multilingue avec un gain de +24,75 points sur XNLI 32.
- Angle possible pour une vidéo YouTube : "Extraction IA sans GPU ? Comment GLiNER 2.5 bat les LLM lourds en analyse de documents (test 74M params vs GPT)"
- Source originale : MarkTechPost / Fastino Technical Blog
- URL directe :
Liquid AI Pipette : Benchmark open-source des LLM sur edge (device + runtime + quantization)
- Date : 23/08/2026
- Catégorie : outil / méthode / conseil d'usage
- Résumé technique : Liquid AI, en partenariat avec Artificial Analysis, a lancé Pipette, une plateforme Apache 2.0 qui benchmark les configurations de déploiement plutôt que les modèles isolés. L'unité de mesure est
modèle + quantization + runtime + device. Le dataset initial couvre 1 000+ configurations, 30+ modèles, llama.cpp sur macOS/iOS/Android/Windows, et des contextes de 256 à 8 192 tokens. Les runs sont validés thermiquement et les scores qualité (IFBench, GPQA Diamond) sont mesurés sur H100 puis croisés avec les performances edge 29. - Pourquoi c’est intéressant : Preuve concrète que deux modèles de même taille et quantisation peuvent diverger de 78,4% vs 33,8% de rétention de throughput selon l'architecture sparse ou dense. Indispensable pour les développeurs embarqués, les fabricants d'OEM et les startups qui doivent choisir un runtime/quantization sans deviner le comportement réel sur silicium 29.
- Angle possible pour une vidéo YouTube : "Pourquoi le même modèle IA fait 3x plus lent sur iPhone vs Android : analyse Pipette de Liquid AI"
- Source originale : MarkTechPost / Artificial Analysis
- URL directe :
Google Gemini Enterprise for Legal : Agent IA sectoriel avec connecteurs gouvernés et ethical walls préservés
- Date : 25/08/2026
- Catégorie : agent IA / automatisation / outil entreprise
- Résumé technique : Google Cloud a lancé la version prévisualisation de Gemini Enterprise pour le droit, packagée avec des skills juridiques (review contractuel, redaction, recherche jurisprudentielle), des agents pré-construits et des connecteurs MCP sécurisés vers iManage, NetDocuments, Docusign, RelativityOne, Harvey, Thomson Reuters HighQ et CourtListener. Le plan de contrôle applique une isolation stricte : les données clients, playbooks et outputs ne servent jamais à l'entraînement des fondations, et les permissions héritent des ethical walls et du RBAC des systèmes sous-jacents 36.
- Pourquoi c’est intéressant : Marque le passage de l'IA juridique "chatbot" à une architecture agentifiée connectée aux DMS/LegalTech existants sans briser la gouvernance. Permet aux cabinets de déployer des workflows automatisés (tri de découverte électronique, screening réglementaire) tout en restant conformes au barreau et aux politiques internes 36.
- Angle possible pour une vidéo YouTube : "L'IA agent dans les cabinets d'avocats : comment Google Gemini Enterprise connecte Relativity, Docusign et Harvey sans fuiter de données"
- Source originale : Unite.ai / Google Cloud Blog
- URL directe :