Microsoft 365 Copilot y el fin de la era del modelo único para la IA empresarial – GeekWire

Microsoft 365 Copilot y el fin de la era del modelo único para la IA empresarial – GeekWire

Steve Gustavson, vicepresidente de diseño e investigación de Microsoft. (Foto de Microsoft)

(Nota del editor: Agents of Transformation es una serie independiente de GeekWire producida por Accenture que explora la adopción y el impacto de la IA y los agentes. Consulte nuestra cobertura de eventos relacionados).

Todavía hay un asterisco tácito cuando se utiliza un modelo de IA: verifique antes de actuar. Hecho – comprobar. Googlealo. Pregúntale a un colega. Al fin y al cabo, el peso de la precisión siempre ha recaído en el ser humano. Pero Microsoft cree que tiene una manera de aliviar esa carga: haciendo que dos IA se supervisen entre sí.

En un momento en que las tareas de la fuerza laboral son cada vez más manejadas por agentes de inteligencia artificial, esta estrategia multimodelo ahora incluye lo que se pensaba que era dominio exclusivo de los humanos: la adjudicación. La participación humana en el circuito ha sido durante mucho tiempo algo innegociable en los flujos de trabajo de IA. El enfoque de Microsoft no elimina esto, pero plantea la cuestión de cuánto de este papel queremos delegar.

«Dos cabezas piensan mejor que una»

Microsoft no está solo en esta apuesta. Amazon Web Services, Google y otros están creando plataformas que brindan a las empresas acceso a múltiples modelos a través de una única interfaz.

AWS Bedrock ofrece acceso a modelos fundamentales de múltiples proveedores, mientras que Google Gemini Enterprise ofrece una única puerta de entrada a la IA en el lugar de trabajo. Lo que diferencia a Microsoft es que incorpora la visualización multimodelo directamente en una herramienta de productividad utilizada por millones de trabajadores.

La semana pasada implementamos este plan por primera vez con nuevas actualizaciones de Microsoft 365 Copilot. Su agente de investigación ahora puede usar GPT de OpenAI para redactar una respuesta y luego hacer que Claude de Anthropic la revise para verificar su precisión, integridad y calidad de las citas antes de finalizarla.

«Queremos conscientemente diversidad de opiniones», dijo a GeekWire Steve Gustavson, vicepresidente de diseño e investigación de Microsoft, en una entrevista. «Dos cabezas piensan mejor que una cuando se juntan.»

Ésta no es una preocupación trivial. Las investigaciones ya han demostrado que los usuarios de IA tienden a transferir el pensamiento crítico a modelos que perciben como autoritarios. Si ya estamos juzgando un modelo, ¿rechazar el segundo por el primero podría ser una prueba perdida?

Ésa es la pregunta con la que Microsoft luchó en el desarrollo de Critique y Council, dos nuevas características del Research Agent.

«Nuestra investigación muestra consistentemente que los empleados continúan deseando una confianza más profunda en la IA y en el contenido de calidad», dijo Gustavson. «La gente, o confía demasiado en la IA, aceptando afirmaciones que no debería, o no confía en ella y no obtiene todo el valor de ella. Tanto el diseño como las capacidades técnicas».

Tomemos como ejemplo la función de crítica de Microsoft. Gustavson dijo que Microsoft creó esto con un traspaso deliberado: GPT lidera la generación y Claude asume el revisor.

«La distinción es importante porque la evaluación es una forma diferente de conocer que las generaciones», dijo. «Cuando un modelo hace ambas cosas, terminas con los mismos puntos ciegos dos veces. Cuando el trabajo del segundo modelo es confirmar el primero, terminas con algo estructuralmente diferente».

Esto crea un «poderoso circuito de retroalimentación que ofrece precisión fáctica, alcance de análisis y resultados de presentación de mayor calidad», escribió Gaurav Anand, vicepresidente de ingeniería de Microsoft, en una publicación de blog técnico sobre la función de crítica M365.

Multimodelo no es sólo una prueba de concepto: está en vivo y ya es la experiencia predeterminada del investigador. Pero Gustavson se apresura a señalar que a la mayoría de los empleados no les importa qué modelos se ejecutan bajo el capó. Los modelos, en su opinión, deberían ser invisibles.

«El consumidor medio quiere resultados fenomenales. Quiere confiar en ellos», afirmó. «¿Tienen que saber que es 5,2 contra algo? No lo creo».

Gustavson sostiene que este es un caso en el que un ciego guía a otro ciego, y enfatiza que la coincidencia de patrones es una forma de evitar alucinaciones. Con Researcher, «Claude resultó ser un sintetizador fantástico y en cierto modo probó lo que podían hacer los modelos GPT».

Sin embargo, Gustavson dijo que Microsoft evalúa constantemente el rendimiento de los modelos individuales frente a los modelos duales, además de nombrar un «juez LLM entre los dos» para ver las compensaciones.

Gustavson dijo que Microsoft planea dejar de promocionar nombres de modelos específicos y centrarse en lo que el empleado está tratando de lograr. Por ejemplo, dijo, los empleados podrían especificar que trabajan en finanzas, y Copilot dirigiría el trabajo a aquellos modelos que son mejores en el manejo de Excel, síntesis y análisis de datos, sin necesidad de recopilar el modelo.

Péndulo de IA empresarial

Para Microsoft, la característica de múltiples modelos es menor que la dirección inevitable de la IA de la empresa. Gustavson lo llama una progresión natural y señala que Copilot comenzó con un modelo.

Desde entonces, dice, la industria ha vacilado entre lo que pueden hacer los modelos, cuál debería ser la experiencia del producto y dónde está el foso competitivo.

«Creo que es simplemente una evolución natural», dijo. «Dos modelos son mejores que uno».

Con modelos superándose entre sí cada pocos meses, Microsoft no está apostando por uno solo, está tratando de construir algo que dure más.

A medida que las organizaciones dejan de experimentar con la IA y toman decisiones más importantes a partir de ella, el enfoque de un solo modelo está empezando a mostrar sus límites. La pregunta tal vez no sea si las empresas deberían adoptar modelos multimodelo, sino si están preparadas para adoptar un sistema en el que la inspección esté automatizada, los modelos sean invisibles y la IA revise la IA antes de que un humano vea el resultado.

Más allá de la integración inicial en el agente de investigación, Gustavson dijo que Microsoft planea extender el enfoque multimodelo a sus otras herramientas de IA. Espera que este enfoque se convierta en estándar en toda la industria. En su opinión, incorporar la revisión multimodelo en los flujos de trabajo de los agentes es tanto una buena gestión como un buen diseño.

Si desea crear una experiencia para los agentes, el consejo de Gustavson es simple: trate a los agentes como cualquier proceso con consecuencias significativas. La pregunta principal: «¿Quién controla el trabajo?»

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

    Deja una respuesta

    Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *