Los asistentes de IA viven o mueren por su velocidad. Un asistente tiene que resolverte las cosas, pero en iMessage cuenta con muy pocas formas de demostrarte que está trabajando en tu petición: un tapback, el indicador de escritura o una respuesta corta.
Partyline es un tipo especial de asistente de IA dentro de iMessage. No nos centramos en clasificar tu correo electrónico: creemos que, como ser humano, ni siquiera deberías estar usando el correo. Nuestro objetivo es sacarte de casa, ponerte con otras personas y hacer que lo pases bien. Nuestra métrica de producto es la cantidad de vida de nuestros usuarios que realmente vale la pena vivir.
Sin embargo, para un asistente esto significa competir en un mundo frenético que hace todo lo posible por agotar a nuestros usuarios. Por dejarlos deprimidos e infelices. Pero, sobre todo, por robarles la atención.
Como la gente envía mensajes desde entornos caóticos, tenemos que ser rápidos. Solo disponemos de un instante con nuestro usuario antes de que guarde el teléfono (¡como debe ser!), y no queremos que mire la pantalla ni un segundo más de lo necesario.
Cuando creamos Partyline, nuestras respuestas eran demasiado lentas. Encontrar un lugar o un evento tardaba entre 29 y 46 segundos. Eso es una eternidad cuando estás fuera con amigos. Si eres quien saca el móvil para buscar el próximo sitio, te juegas tu capital social: eres la persona que sabe que hay algo interesante pasando. A los 46 segundos, alguien ya ha sugerido otro lugar y se ha adueñado de la conversación.
Por eso, un asistente en iMessage tiene que ser rapidísimo. Una app te da una pantalla que controlas mientras alguien la usa. iMessage no: la gente lo utiliza en momentos ajetreados y complejos, y el asistente compite contra todo lo que le rodea.
Cómo nos comparamos
Comparamos Partyline con otros dos asistentes personales en iMessage: Tomo e Instinct. Instinct fue el más lento: sus respuestas a las búsquedas tardaban entre 42 y 82 segundos, demasiado tiempo si estás de marcha con tus amigos. Tomo destaca en la conversación. Sus respuestas en el chat llegan en unos pocos segundos y sus resultados de búsqueda tardan entre 28 y 37 segundos, con un tapback a los 2 segundos aproximadamente y un primer mensaje a los 5.

De 46 segundos a 3
Tomo nos planteó la pregunta clave: ¿cómo podía Partyline responder tan rápido como Tomo en una conversación, pero aplicándolo a tareas más pesadas como encontrar lugares y eventos? Empezamos con tiempos de 29 a 46 segundos. Hoy, una búsqueda tarda entre 2 y 3 segundos desde que se envía hasta que llega la respuesta.

Dos cambios marcaron casi toda la diferencia.
Primero, indexamos los eventos por adelantado para los lugares sobre los que la gente más pregunta. Durante la Tech Week de a16z en San Francisco, nuestro inventario incluye unos 1,700 eventos para esa semana, y una búsqueda los filtra en una lista breve en menos de una décima de segundo. Cuando una zona no está indexada, se lanza una búsqueda web en paralelo que responde unos segundos después.
Segundo, integramos clasificadores Jev en varios pasos de nuestro pipeline de mensajes. Jev es el modelo clasificador de TypeSafe. En una sola llamada de unos 0.2 segundos, responde a muchas preguntas sobre un mensaje: qué tipo de petición es, si continúa la búsqueda anterior o si contiene contenido sensible. Jev también ordena los eventos y lugares candidatos, y verifica cada línea de la respuesta frente a los datos que describe. Cuando esas decisiones las tomaba un modelo grande, cada una tardaba unos 4 segundos.

Qué viene ahora
Hoy, Partyline termina de dar una respuesta de búsqueda antes de que Tomo envíe siquiera su primer mensaje, y puede mantener muchas rondas de conversación informal antes de que Instinct responda una sola vez. La contrapartida es que algunas respuestas suenan menos a charla y más a contestación exprés. Estamos trabajando en ello. Nuestro siguiente reto es ajustar el sistema para encontrar un punto intermedio que siga pareciendo instantáneo, pero que se lea como una conversación natural.
También estamos desarrollando herramientas para mantener los costes de inferencia asequibles a medida que crecemos, y así no tener que sacrificar velocidad ni calidad por ahorrar dinero.
A día de hoy, Partyline es el asistente de IA para iMessage más rápido del mundo, especialmente en la búsqueda de eventos. Si esta semana estás en la Tech Week de a16z en San Francisco, escríbele a Partyline y prueba la búsqueda de eventos más veloz que has visto en tu vida.





