
Cet ingénieur a laissé l'IA gérer sa vie pendant 6 mois
Audio Summary
AI Summary
L'évolution des assistants basés sur l'IA repousse sans cesse les limites de ce qui est possible, flirtant avec les mythes d'un assistant personnel omniprésent et ultra-efficace. Maxime, CTO d'une startup, a poussé cette exploration très loin, intégrant un assistant IA dans presque tous les aspects de sa vie, y compris des interactions personnelles. Son expérience permet de distinguer le marketing de la réalité en matière d'IA.
Maxime décrit son rôle de CTO comme un travail où il "ne fait rien et fait tout", ce qui se traduit par une gestion constante d'informations, de communications et de décisions. Face à des centaines d'emails et de messages Slack quotidiens, même dans une entreprise de quelques dizaines de personnes, il se sentait submergé, stressé et anxieux. Ce constat a été le point de départ de son intérêt pour les agents IA, cherchant à alléger sa charge mentale et à mieux vivre son travail.
Le déclic est survenu avec la sortie du premier modèle "speech to speech" d'OpenAI. Jusqu'alors, l'interaction avec les modèles se faisait principalement par texte, avec des latences importantes pour les applications vocales (transcription, traitement, puis synthèse vocale). Le nouveau modèle a permis une interaction vocale plus fluide et rapide. Maxime, qui utilisait déjà Twilio pour la téléphonie, a vu une opportunité. Son premier projet a été d'automatiser la commande d'un kebab. Il a codé le système, a lancé l'agent pour passer la commande par téléphone, puis s'est rendu au restaurant sans écouter la conversation. À sa grande surprise, la commande était prête. Le kebabier n'a rien remarqué d'inhabituel, indiquant à Maxime que le bruit ambiant et le niveau d'attention ne permettaient pas de distinguer une voix synthétique d'une voix humaine. Ce moment, où son code a eu un impact réel, fut une révélation.
L'effervescence autour de projets comme Open Clow a été déclenchée par une innovation apparemment mineure mais cruciale : l'intégration des agents LLM avec les canaux de communication habituels comme WhatsApp ou Telegram. Cela a permis aux utilisateurs d'interagir avec leur agent via les outils qu'ils utilisaient déjà, ouvrant la voie à l'automatisation de la communication et à l'envoi de messages vocaux sans être devant un PC.
Un agent IA se distingue d'un simple chat comme ChatGPT par sa "boucle d'autonomie". Après avoir fourni une réponse, l'agent l'introspection, décide s'il doit continuer, et peut utiliser des outils externes. Il dispose de "compétences" (des manuels d'utilisation pour comprendre comment agir), d'"outils" (accès à internet, à des applications de communication, à l'envoi de courriers) et d'une "mémoire" (historique des conversations et contexte fourni par l'utilisateur). Cette combinaison rend l'agent incroyablement puissant, capable d'accéder et de manipuler des outils informatiques à une vitesse et une efficacité inhumaines. Par exemple, on peut lui envoyer un PDF et lui demander de le diviser en quatre fichiers, de les envoyer par email à un assistant, puis de faire des recherches et de créer un débriefing PowerPoint. Tout ce qu'un humain peut faire sur un ordinateur, l'agent peut le faire s'il en a l'autorisation, soulevant au passage des questions de sécurité.
Les premières utilisations de Maxime se sont concentrées sur les tâches de bureautique répétitives et fastidieuses : conversion de CSV, création de graphiques, de fichiers Excel, ou de présentations PowerPoint. Il a trouvé que l'IA était particulièrement utile pour améliorer la forme de ses présentations, lui permettant de créer des slides esthétiques sans compétences en illustration ou mise en page, se concentrant ainsi sur le fond.
Pour que l'agent soit vraiment efficace, il faut lui fournir beaucoup d'informations personnelles. C'est là que de nombreuses personnes échouent avec des outils comme Open Clow, car elles ne fournissent pas suffisamment de contexte. Maxime a passé des jours, voire des semaines, à "documenter sa vie" pour son agent. Concrètement, il lui parle pendant des heures chaque jour, profitant de la capacité des LLM à comprendre le sens même si les informations sont données dans le désordre ou avec des bafouillements. Il a par exemple documenté l'intégralité de ses vêtements (marque, taille) pour ne plus avoir à chercher ces informations lors d'achats.
Au début, l'agent ne pouvait pas acheter directement, mais préparait le panier. Aujourd'hui, avec des technologies comme "computer use", c'est possible, mais Maxime le fait moins car la plupart des sites e-commerce n'ont pas d'API, obligeant l'agent à utiliser un navigateur et des modèles de vision, ce qui est lent et coûteux. Il préfère que l'agent prépare le panier, puis finalise l'achat manuellement. Cependant, il donne des exemples où l'agent gère des achats, comme l'envoi de fleurs pour l'anniversaire de sa mère.
Maxime a mis en place un système quotidien très élaboré. Chaque matin, il reçoit sur WhatsApp un podcast d'une dizaine de minutes récapitulant les anniversaires de ses proches, les événements de sa journée (rendez-vous à Paris, tournage), et les actualités tech. Ce podcast est devenu indispensable. De plus, son agent génère et projette sur une télévision un programme d'exercices de CrossFit personnalisé, incluant échauffements et rappels techniques, adapté à son niveau et aux équipements dont il dispose. L'avantage principal est l'adaptation exacte à ses besoins, ce qu'une application générique ne pourrait pas faire.
Quant à la délégation de réponses, Maxime précise que tous les messages ne sont pas gérés automatiquement. L'agent répond aux messages "faciles", notamment ceux qui demandent un simple accusé de réception ou qui concernent des informations déjà disponibles publiquement. Il a créé un dossier spécifique dans sa base de connaissances où l'agent est autorisé à piocher pour répondre automatiquement. L'objectif est de réduire les interruptions et la charge mentale, en regroupant les informations dans un résumé bi-quotidien plutôt que d'être dérangé toutes les deux minutes. L'agent est programmé pour avoir le "ton de voix" de Maxime, ayant ingéré ses conversations WhatsApp pour cela.
Une anecdote amusante s'est produite au travail. Maxime publie souvent des documents. Son système écoute les commentaires liés à ces documents. Si une correction factuelle et sourcée est apportée, l'agent réédite le PDF avec la correction, présente des excuses, et renvoie le document. Lors d'une présentation en face à face avec son patron, Jean-Louis, ce dernier a envoyé une correction sur Slack. Pendant que Maxime parlait, l'agent a mis à jour le document en temps réel. Cette automatisation, bien que Maxime soit transparent sur l'utilisation de l'IA, a surpris son patron, qui n'avait pas réalisé à quel point le système était autonome.
Maxime a rencontré peu de réactions négatives, mais a fait une erreur de transparence avec sa compagne. Au début de l'expérimentation, il a demandé à l'agent d'organiser un week-end sans la prévenir. Le week-end fut excellent (restaurant réservé en ligne, spot de van trouvé, randonnée), mais en révélant que l'agent était l'organisateur, il a compris que l'expérience n'avait pas été vécue de la même manière. Le fait que l'IA agisse sans qu'elle le sache posait un problème de confiance.
Le bilan de cette intégration poussée est extrêmement positif. Maxime décrit un "jour et la nuit" en termes de charge mentale et d'efficacité. La centralisation de tous ses canaux de communication dans une seule interface a été une révolution. De plus, l'agent filtre une immense partie du "bruit" informationnel. Contrairement aux filtres manuels, l'agent peut identifier les informations pertinentes au milieu du flux, évitant par exemple de rater un email important d'AWS sur un dépassement de budget. Passer de milliers à une dizaine de sollicitations quotidiennes réduit considérablement l'anxiété.
Maxime ressent quotidiennement la possibilité de rater une information, mais c'est ainsi qu'il construit et améliore son système. Chaque "raté" est une "cicatrice" qui l'incite à ajouter une règle, améliorant le système de manière itérative, comme un développeur débuggue son code. Son agent s'appelle "Avant-Garde".
Pour préparer l'émission, Maxime a utilisé son agent pour analyser les transcripts et les commentaires de toutes les vidéos UNDORE des six derniers mois. L'agent a catégorisé les commentaires, permettant à Maxime de comprendre ce qui était apprécié ou non par la communauté. Il a découvert des choses évidentes (communauté bienveillante) et d'autres surprenantes, comme le fait que les anglicismes étaient mal vus, ou l'existence de "jeux d'alcool" sur certains tics de langage des présentateurs (par exemple, le mot "en fait"). Cette analyse, qui a pris moins d'une heure à l'agent et quelques secondes à Maxime, a été très utile.
Le coût mensuel de son système est inférieur à 500 dollars, incluant un Mac Mini. En matière de gestion des données et de vie privée, Maxime privilégie les services qui garantissent que les données ne sont pas utilisées pour entraîner les modèles et qu'elles sont stockées et traitées sur le territoire européen (comme Open Router). Le fantasme des modèles locaux a longtemps été limité par leur performance et leur coût, mais de nouveaux modèles comme ceux de Quen et Google (Jema) sont performants même sur de petites machines. Apple, avec sa mémoire unifiée, a également contribué à rendre les modèles locaux plus viables. Maxime est en train de migrer sa base de connaissances vers un serveur local et expérimente avec Quen, notant que la principale difficulté réside encore dans la qualité de la rédaction de texte en français, qui nécessite les meilleurs modèles.
Pour ceux qui souhaitent se lancer, Maxime conseille de commencer simplement : utiliser son éditeur de texte habituel, y insérer quelques connaissances, et ajouter un outil comme Claude Code. Une fois que l'agent est bloqué par la nécessité d'interagir avec le monde extérieur, des ressources comme le répertoire des MCP d'Anthropic ou le site Skills.sh (référençant des manuels pour utiliser les services en ligne) sont très utiles.
Mathieu, l'hôte de l'émission, partage également son expérience. Il a trouvé l'idée du "heartbeat" (un modèle qui se déclenche tout seul sur un événement) fascinante au début, mais ne l'a pas gardée. En revanche, il utilise un répertoire local où il stocke tous ses documents (juridiques, etc.) et a trouvé un outil, Message Volt, qui synchronise localement ses boîtes mail Google. Cela lui permet d'utiliser des agents pour analyser des années de mails, retrouver des conversations spécifiques, classer des PDF, ou vérifier des contrats. La capacité des outils comme Claude Code à explorer d'énormes bases de données non structurées (comme des piles de mails ou de fichiers Markdown) est devenue indispensable. Ces agents peuvent même "donner naissance" à des sous-agents pour effectuer des recherches parallèles, offrant un "super pouvoir" d'exploration et d'analyse.
En conclusion, l'utilisation des agents IA de manière "inhumaine" – c'est-à-dire en exploitant leurs capacités uniques de vitesse, d'exploration et d'automatisation à une échelle que l'humain ne peut atteindre – est la clé pour transformer radicalement l'efficacité personnelle et réduire la charge mentale.