
LIVE: DevDay 2026
Audio Summary
AI Summary
L'épisode traite des avancées en matière d'agents personnels et de l'intégration de l'IA dans la vie quotidienne. Un agent personnel capable de gérer des tâches complexes sur de longues périodes est en développement, avec un accent sur la persistance de la mémoire sur plusieurs semaines ou mois. Cet agent peut être contrôlé avec précision en termes d'accès aux applications et devrait devenir une extension naturelle de l'utilisateur.
Un exemple d'application est le triage des défauts de fabrication dans l'industrie du matériel. Les ingénieurs utilisent un agent pour trier les informations provenant de Slack et des e-mails, prenant des décisions initiales et même utilisant des logiciels de CAO. Cet agent permet aux individus d'élargir la portée de leur travail.
Il est précisé que les modèles internes utilisés pour les incidents divulgués n'étaient pas des modèles de production comme Astro. Le produit principal est Astro, un modèle large et très performant. L'entreprise est fière de ses progrès vers un assistant personnel incroyable et s'attend à ce que l'IA s'intègre de manière transparente dans la vie des utilisateurs, accessible via des appels, des réunions, des e-mails et des SMS.
Concernant la sécurité, l'intention est de poursuivre les produits d'IA tout en assurant la compétence et la sécurité. Une nouvelle pratique de rédaction d'évaluations de sécurité a été lancée, encourageant la participation du public.
Une discussion a lieu sur GPT 6.1 Soul. Mike le considère comme le modèle le plus performant selon ses benchmarks, bien qu'il préfère les modèles Claude. Il excelle dans la plupart des tâches, notamment la création de tableaux de bord MPS avec un bon design et des idées intéressantes pour les présentations PowerPoint, y compris l'ajout de tâches illustratives. Il est caractérisé comme un "Astra Light" ou "Soul Smart", se situant entre Astra et Soul. L'utilisation informatique est excellente, avec une meilleure conscience visuelle, comme en témoigne une carte de Hoboken bien conçue.
Les inconvénients incluent un "goût GPT" dans le design, avec des éléments mignons qui rappellent des pages de marketing. L'écriture est jugée ennuyeuse et peu naturelle, avec des sections de longueur presque égale, ce qui est un indicateur d'IA. Il n'utilise pas les citations percutantes du contexte donné. Malgré cela, Mike considérerait l'utiliser comme une alternative moins chère à Astra s'il était moins cher.
Kieran partage son opinion, décrivant GPT 6.1 Soul comme "Astra mais plus rapide". Il note des similitudes de conception avec Astra et 6.1 Soul, suggérant un post-entraînement similaire. Il est plus détaillé que le Soul précédent et a réussi son benchmark le plus difficile, "proof from scratch". Kieran le recommande comme un remplacement d'Astra, car il est plus rapide, moins cher et excellent pour l'utilisation informatique.
La conversation aborde ensuite la réduction des limites d'utilisation, impliquant des coûts plus élevés. Une démonstration en direct de "proof from scratch" montre que GPT 6.1 Soul fonctionne bien avec les websockets, ce qui indique que OpenAI se rapproche des performances d'Anthropic. Le choix entre les deux dépend désormais davantage du style de travail personnel.
Mike et Kieran discutent de leurs attentes pour les futurs produits d'IA. Mike est impatient de voir la version ultra-rapide, car il souhaite une IA suffisamment rapide pour éviter le multithreading dans ses flux de travail. Kieran est enthousiasmé par le produit DOS, qu'il utilise pour le travail informatique, et se demande comment tous les éléments s'intégreront, en particulier par rapport à des concurrents comme Cursor et Grobot.
Des questions sont posées à Sam concernant l'orientation de l'entreprise, compte tenu de la multitude de projets en cours. Kieran s'interroge sur l'avenir des marketeurs si 95% de leur travail peut être automatisé.
La discussion se termine par des remarques sur le Luna Decisions API, que Mike apprécie pour sa multimodalité et son potentiel à ouvrir de nouveaux cas d'utilisation, bien qu'il se demande pourquoi OpenAI s'y concentre, étant donné les faibles marges. Il note que Luna est parfois moins chère que Jeff pour certaines utilisations.