Les assistants IA vivent ou meurent par leur rapidité. Un assistant doit accomplir des tâches pour vous, mais sur iMessage, il dispose de très peu de moyens pour vous montrer qu'il traite votre demande : un tapback, une bulle de saisie, une réponse courte.
Partyline est un type d'assistant IA bien particulier dans votre iMessage. Nous ne cherchons pas à trier vos e-mails : selon nous, en tant qu'être humain, vous n'auriez jamais dû utiliser les e-mails en premier lieu. Notre objectif est de vous faire sortir, avec d'autres personnes, pour passer un bon moment. Notre indicateur produit, c'est la quantité de vie de nos utilisateurs qui vaut vraiment la peine d'être vécue.
Pour un assistant, cependant, cela signifie rivaliser dans un monde extrêmement saturé qui fait tout pour épuiser nos utilisateurs. Les rendre déprimés et malheureux. Mais surtout, se battre pour capter leur attention.
Comme les gens envoient des messages depuis des environnements chaotiques, nous devons être rapides. Nous n'avons qu'un bref instant avec notre utilisateur avant qu'il ne range son téléphone (et c'est très bien ainsi !), et nous ne voulons pas qu'il garde les yeux rivés sur l'écran une seconde de plus que nécessaire.
Lorsque nous avons créé Partyline, nos réponses étaient trop lentes. Trouver un lieu ou un événement prenait entre 29 et 46 secondes. C'est une éternité quand on est de sortie avec des amis. Si vous êtes celui qui dégaine son téléphone pour trouver le prochain endroit, vous mettez votre capital social en jeu : vous êtes la personne qui sait qu'un truc cool se passe quelque part. À 46 secondes, quelqu'un d'autre a déjà proposé un lieu et repris le contrôle de la conversation.
Un assistant iMessage doit donc être ultra rapide. Une application vous offre un écran que vous maîtrisez pendant son utilisation. Pas iMessage : les gens s'en servent dans des moments chargés et complexes, et l'assistant est en concurrence avec tout ce qui les entoure.
Comment nous nous comparons
Nous avons comparé Partyline à deux autres assistants personnels sur iMessage, Tomo et Instinct. Instinct était le plus lent : ses réponses aux recherches prenaient de 42 à 82 secondes, ce qui est beaucoup trop long pour une utilisation entre amis. Tomo excelle dans la conversation. Ses réponses textuelles arrivent en quelques secondes, et ses résultats de recherche prennent de 28 à 37 secondes, avec un tapback au bout d'environ 2 secondes et un premier message vers 5 secondes.

De 46 secondes à 3
Tomo nous a posé la question de référence : comment Partyline pourrait-il répondre aussi vite que Tomo dans la conversation, mais pour des tâches plus lourdes comme trouver des lieux et des événements ? Nous partions de 29 à 46 secondes. Aujourd'hui, une recherche prend de 2 à 3 secondes entre l'envoi et la réponse.

Deux changements ont fait presque toute la différence.
Premièrement, nous indexons à l'avance les événements pour les lieux les plus demandés. Pendant la Tech Week d'a16z à San Francisco, notre inventaire contient environ 1 700 événements pour la semaine, et une recherche les réduit à une courte liste en moins d'un dixième de seconde. Lorsqu'une zone n'est pas indexée, une recherche web s'exécute en parallèle et fournit une réponse quelques secondes plus tard.
Deuxièmement, nous avons intégré des classificateurs Jev à plusieurs étapes de notre pipeline de messages. Jev est le modèle de classification de TypeSafe. En un seul appel d'environ 0,2 seconde, il répond à de nombreuses questions sur un message : quel type de requête il s'agit, si elle poursuit la dernière recherche, si elle est sensible. Jev classe également les événements et lieux candidats, et vérifie chaque ligne d'une réponse par rapport aux données qu'elle décrit. Quand un grand modèle prenait ces décisions, chacune nécessitait environ 4 secondes.

Et maintenant ?
Aujourd'hui, Partyline termine sa réponse à une recherche avant même que Tomo n'envoie son premier message, et peut enchaîner de nombreux échanges informels avant qu'Instinct ne réponde une seule fois. Le revers de la médaille, c'est que certaines réponses ressemblent moins à une conversation et davantage à une réaction expéditive. Nous y travaillons. Notre prochain défi est d'ajuster le système pour trouver un juste milieu : une sensation toujours quasi instantanée, mais avec le naturel d'une vraie conversation.
Nous développons également des outils pour maintenir les coûts d'inférence abordables à mesure que nous grandissons, afin de ne jamais avoir à sacrifier la vitesse ou la qualité pour des raisons budgétaires.
Aujourd'hui, Partyline est l'assistant IA iMessage le plus rapide au monde, en particulier pour la recherche d'événements. Si vous participez à la Tech Week d'a16z à San Francisco cette semaine, envoyez un message à Partyline pour découvrir la recherche d'événements la plus fulgurante que vous ayez jamais vue.





