Saltar al contenido
FenixIAm by AIworks 2028 FenixIAm

Centro de Inteligencia Edición de septiembre de 2026 6 piezas

Lo que hay que saber antes de poner la IA a trabajar.

Guías y análisis escritos desde la experiencia de construir agentes para negocios reales: cómo medir, qué exige la norma, qué modelo elegir y dónde no conviene usar IA. Para quien tiene que decidir, sin humo.

01Formación

Cómo medir un roleplay comercial sin engañarse

· 2 min de lectura

Una nota sin la frase que la respalda no ayuda a mejorar. Criterios observables, citas literales y evolución en el tiempo: así un ensayo se convierte en aprendizaje.

Criterios que se puedan oír

El primer error es evaluar lo que no se ve. «Actitud positiva» o «seguridad» dependen de quien escucha. Un buen criterio describe una conducta que se puede señalar en la transcripción: «pregunta por la necesidad antes de presentar el producto», «reformula la objeción antes de responderla», «propone un siguiente paso con fecha». Entre ocho y diez criterios bastan; con más, el informe se convierte en ruido.

Cada criterio necesita una escala con anclas. Si va de 0 a 10, hay que escribir qué es un 3, un 6 y un 9, con ejemplos. Sin anclas, dos evaluadores, humanos o no, puntúan la misma conversación de forma distinta.

Cada nota, con su cita

Una nota solo sirve si llega con la frase que la justifica y el minuto en que se dijo. La cita permite al comercial entender qué hizo bien o mal, y al formador comprobar si la evaluación es justa. Si el sistema no encuentra una frase que respalde la nota, la nota no debería existir.

En sectores regulados hace falta una comprobación más: si lo que se afirmó sobre el producto es correcto según la documentación oficial. Una conversación brillante con un dato falso es un riesgo, no un éxito.

La evolución, no la foto

Una sesión aislada dice poco: influyen el escenario, el día y el cliente simulado. Lo que importa es la tendencia en el mismo escenario a lo largo de varias sesiones, qué criterios mejoran y cuáles se estancan. Conviene subir la dificultad del cliente simulado solo cuando los criterios básicos se sostienen.

Sesgos que conviene vigilar

  • Premiar la longitud: hablar más no es vender mejor. Un criterio de escucha lo compensa.
  • El efecto halo: un buen arranque no debe inflar el resto. Cada criterio se puntúa con su propia cita.
  • Los errores de transcripción: un acento o una línea con ruido pueden penalizar a quien no lo merece. Las notas bajas se revisan con el audio.
  • Premiar el guion: recitar el argumentario no es escuchar. Se evalúa si la respuesta encaja con lo que dijo el cliente.
  • Juzgar a la persona en lugar de la conversación: se mide lo que se dijo, no cómo se sentía quien lo dijo.

Por último, calibra. Cada cierto tiempo, un formador puntúa a mano una muestra de sesiones y compara su nota con la del sistema. Si discrepan, se ajustan las anclas; no se fuerza el resultado.

Volver al índice

02Normativa

El Reglamento Europeo de IA y la formación con IA: qué aplica ya y qué llega en 2027

· 2 min de lectura

Desde el 2 de agosto de 2026 hay que avisar de que se habla con una IA. El 2 de diciembre de 2027 llegan las obligaciones de alto riesgo para los sistemas que evalúan a trabajadores. Esto es lo que conviene hacer ahora.

Ya aplica: avisar de que es una IA

El artículo 50 del Reglamento (UE) 2024/1689 se aplica desde el 2 de agosto de 2026. Exige que quien conversa con un sistema de IA lo sepa, salvo que resulte evidente por el contexto. En un roleplay de formación el contexto suele dejarlo claro, pero no conviene apoyarse en eso: un aviso al empezar cada sesión, por escrito y de viva voz, elimina la duda. Además, los proveedores de sistemas que generan audio, imagen, vídeo o texto sintéticos deben marcarlos de forma legible por máquina.

Ya estaba prohibido: deducir cómo se siente el trabajador

Desde febrero de 2025, el artículo 5 prohíbe en el lugar de trabajo y en los centros educativos los sistemas que deducen el estado de ánimo o los sentimientos de una persona a partir de su voz, su cara u otros datos biométricos, salvo por motivos médicos o de seguridad. Para la formación comercial significa algo muy concreto: el sistema puede evaluar qué se dijo y cómo se condujo la conversación, pero no puede concluir que el comercial estaba nervioso, inseguro o aburrido.

Llega en diciembre de 2027: alto riesgo

El Reglamento considera de alto riesgo los sistemas destinados a supervisar y evaluar el rendimiento y el comportamiento de los trabajadores. Tras la modificación de 2026 (Reglamento (UE) 2026/1744), esas obligaciones se aplican desde el 2 de diciembre de 2027: gestión de riesgos, documentación técnica, registros y supervisión humana, y, para la empresa que lo usa, informar antes a los trabajadores afectados y a sus representantes.

La clasificación depende del uso previsto y conviene analizarla con un asesor. Un ensayo privado cuyo resultado solo ve la persona que practica está lejos de ese supuesto. Si las notas alimentan evaluaciones, incentivos o decisiones sobre la carrera de alguien, el sistema entra de lleno en él.

Qué hacer ya

  • Avisar al inicio de cada sesión de que la otra parte es una IA, aunque parezca obvio.
  • Revisar los criterios de evaluación y quitar cualquiera que dependa de adivinar cómo se siente la persona.
  • Separar el ensayo privado de la evaluación y decidir por escrito qué resultados ve la empresa y con qué fin.
  • Pedir el consentimiento de cada persona antes de compartir sus resultados.
  • Documentar desde ahora los criterios, las fuentes y quién revisa las notas: es la base de lo que se exigirá en 2027.
  • Explicar a quienes usan y supervisan el sistema qué hace y qué no hace la herramienta.

Este texto es orientativo y no sustituye el asesoramiento jurídico de cada caso.

Volver al índice

03Sector público

IA en la contratación pública: preparar, comprobar y redactar, sí; decidir, no

· 2 min de lectura

La IA puede ahorrar horas en cada expediente de contratación. Lo que no puede es ocupar el lugar de quien firma. Dónde está la línea y cómo se diseña un sistema que la respete.

Un expediente de contratación es, en buena parte, trabajo documental: reunir datos dispersos, calcular importes, comprobar que no falta nada y redactar documentos que siguen modelos conocidos. Ahí la IA aporta mucho. Pero el expediente termina en actos administrativos que alguien tiene que motivar y firmar, y esa responsabilidad no se delega en una máquina.

Lo que sí: preparar

Extraer de la memoria, del presupuesto o de contratos anteriores los datos que el expediente necesita: objeto, duración, lotes y precios unitarios. Proponer el cálculo del valor estimado con su desglose, para que el técnico lo revise en lugar de construirlo desde cero.

Lo que sí: comprobar

Verificar que están todos los documentos que exige el tipo de contrato, por ejemplo el informe de insuficiencia de medios en un contrato de servicios; que las cifras cuadran entre documentos y que los plazos son coherentes. Si falta algo, el expediente no debe avanzar: un bloqueo claro evita errores que después cuestan un recurso.

Lo que sí: redactar

Generar los borradores de la memoria justificativa, los informes y los pliegos a partir de las plantillas de la entidad, con su nombre y su escudo, listos para revisar en Word y Excel. El técnico corrige y firma; el borrador le ahorra la parte mecánica.

Lo que no: decidir, adjudicar ni fiscalizar

La necesidad del contrato, el procedimiento y los criterios los decide el órgano de contratación. La valoración de las ofertas que depende de juicios de valor corresponde a la mesa o al comité de expertos, y la adjudicación, al órgano de contratación. La fiscalización es tarea de la intervención. La IA puede señalar que una oferta parece anormalmente baja, pero apreciarlo exige pedir justificación al licitador y decidir de forma motivada. Eso lo hace una persona.

Si alguna vez se automatiza una actuación, la Ley 40/2015 obliga a fijar antes qué órgano es competente y quién responde de ella. Cuando la IA solo prepara, comprueba y redacta, el responsable sigue siendo quien firma, y el sistema debe dejarlo claro.

Cómo se reconoce un buen diseño

  • Cada dato extraído indica de qué documento sale.
  • Cada borrador se puede editar antes de firmarse.
  • Los bloqueos explican qué falta y por qué.
  • Al final, el expediente completo se exporta en un paquete que cualquiera puede revisar.
Volver al índice

04Modelos

Radar de modelos, septiembre de 2026: qué vigilar y cómo elegir

· 2 min de lectura

Septiembre ha traído una generación nueva en casi todos los grandes proveedores. Qué familias conviene seguir y un método para elegir modelo por tarea, coste y latencia que aguante la próxima novedad.

Las familias que conviene vigilar

OpenAI ha estrenado la generación GPT-6, con un modelo de referencia para el razonamiento y dos niveles más ligeros para el trabajo diario y el gran volumen. Anthropic ha renovado su gama alta con Claude Opus 5.5, fuerte en tareas largas y en agentes que usan herramientas. Google renueva Gemini Flash cada pocas semanas, ya en la versión 3.8, y publica modelos específicos para voz en directo y lectura en voz alta. xAI ha lanzado Grok 4.7. DeepSeek mantiene la presión en coste con modelos de pesos abiertos, y los mejores modelos abiertos (Qwen, GLM, Kimi y otros) ya compiten con modelos cerrados de hace pocos meses. Mistral sigue siendo la opción europea de referencia.

Elegir por tarea, no por ranking

Las clasificaciones generales cambian cada semana y miden cosas que quizá no necesitas. Es más útil ordenar las tareas del negocio en tres grupos:

  • Razonamiento difícil y poco frecuente, como analizar un contrato, revisar un informe largo o planificar: compensa el modelo más capaz, aunque sea más lento y más caro.
  • Trabajo diario de volumen medio, como redactar, resumir, clasificar o evaluar una conversación con una rúbrica: un modelo intermedio suele dar la misma calidad por mucho menos.
  • Gran volumen o respuesta inmediata, como extraer campos o hablar por teléfono: modelos ligeros o de baja latencia. En voz lo que importa es contestar en menos de un segundo y no pisar a la persona.

Coste y latencia se miden, no se suponen

El precio por token engaña: un modelo barato que necesita tres intentos o escribe respuestas muy largas acaba costando más. Lo que cuenta es el coste por tarea terminada y bien hecha. Por eso conviene medir el coste de cada mensaje en producción y fijar un tope mensual por agente. En latencia, mide el tiempo hasta la primera palabra y no solo el total, sobre todo en voz.

Un método que dura

Guarda una batería de veinte o treinta casos reales con la respuesta esperada. Cuando salga un modelo nuevo, pásala, compara calidad, coste y tiempo con el actual y decide. Si cambiar de modelo obliga a rehacer el agente, el problema no es el modelo, es la arquitectura: el agente debe cambiar de modelo con un ajuste, y conviene tener un segundo modelo preparado por si el primero falla.

Volver al índice

05Atención

Voz de IA en hostelería: qué funciona de noche y qué no

· 2 min de lectura

Entre la medianoche y el desayuno, la recepción de muchos hoteles depende de una sola persona o de nadie. Una recepcionista de voz ayuda mucho en unas cosas y nada en otras. Esto es lo que hemos aprendido preparando una recepción de demostración.

Lo que funciona

  • Las preguntas frecuentes a cualquier hora: horario del desayuno, hora de salida, aparcamiento, wifi o cómo llegar. Son la mayoría de las llamadas nocturnas y tienen respuesta fija.
  • Atender en el idioma del huésped. Quien llama de madrugada desde otro país agradece que le entiendan a la primera, y la recepción de voz cambia de idioma sin cambiar de número.
  • Tomar nota de peticiones: salida tardía, una cuna, un taxi temprano. La IA no confirma lo que no puede confirmar; lo deja escrito, con habitación, hora e idioma, para que el equipo de mañana lo resuelva a primera hora.
  • Liberar al recepcionista de noche, que puede atender a quien está en el mostrador.

Lo que no funciona y no debe intentarse

  • Las urgencias. Un problema de salud, un incendio o una situación de seguridad se pasan de inmediato a una persona o al 112. La IA no valora ni tranquiliza en esos casos: transfiere.
  • Los cobros por teléfono. Nunca se piden ni se dictan datos de tarjeta a una voz de IA. Si hay que pagar, se envía un enlace seguro o se hace en recepción.
  • Confirmar disponibilidad o precios sin conexión con el motor de reservas. Si el sistema no ve el inventario real, dice que toma nota y que se confirmará; no se lo inventa.
  • Las quejas delicadas. Un huésped enfadado de madrugada necesita a alguien que pueda decidir una compensación. La IA recoge el caso y lo escala.

Tres reglas de diseño

Primera: avisar desde el primer segundo de que es una recepcionista de IA. El Reglamento Europeo de IA lo exige desde agosto de 2026 y, además, evita malentendidos. Segunda: dejar siempre una salida hacia una persona o, si no hay nadie, hacia un teléfono de guardia. Tercera: medir. Cada llamada debe terminar en una ficha estructurada, con quién llamó, qué pidió, en qué idioma y en qué estado queda, para que el equipo de mañana no tenga que escuchar grabaciones.

Bien planteada, la voz de IA no sustituye a la recepción: cubre las horas en que nadie contesta y entrega el trabajo ordenado a quien llega por la mañana.

Volver al índice

06Privacidad

Privacidad por diseño en la evaluación de equipos

· 2 min de lectura

Si un equipo teme lo que la empresa verá de sus ensayos, practicará menos y peor. La privacidad no frena la formación: es la condición para que funcione.

Consentimiento persona a persona

Cada persona decide si comparte sus resultados individuales con la empresa, y puede cambiar de opinión. La pregunta se hace de forma clara, separada de otros avisos y sin consecuencias por decir que no. Mientras no haya consentimiento, los resultados de esa persona no aparecen con su nombre en ningún informe, y si lo retira, dejan de mostrarse desde ese momento.

Es la aplicación directa del principio de protección de datos desde el diseño del RGPD (artículo 25): lo privado es el punto de partida y compartir es una decisión activa.

Los grupos pequeños no se muestran

Un informe agregado puede delatar a una persona si el grupo es pequeño. Si un equipo tiene tres miembros y dos comparten sus notas, la media revela la del tercero. Por eso los grupos de tres personas o menos no se muestran en los consolidados, y quien no ha dado su consentimiento solo cuenta en totales que no permiten identificarle.

Los ensayos personales son privados

Hay ensayos que solo sirven a quien los hace: preparar una conversación difícil, una negociación o una entrevista. Esos ensayos no llegan a ningún panel de la empresa. Si la persona quiere enseñarlos, lo decide ella. Quien sabe que su ensayo es privado se atreve a practicar lo que peor lleva, que es justo lo que más necesita.

Qué se mide y qué no

Se evalúa la conversación, no a la persona: qué se dijo, si se siguió la metodología y si los datos eran correctos. No se deduce cómo se siente nadie a partir de su voz, algo que el Reglamento Europeo de IA prohíbe en el trabajo. Y los criterios son públicos para quien es evaluado: nadie debería recibir una nota con reglas que no conoce.

Lista de comprobación

  • Finalidad escrita: para qué se usan los resultados y para qué no.
  • Consentimiento individual, revocable y registrado.
  • Un tamaño mínimo de grupo en todos los informes agregados.
  • Accesos por rol: el formador ve lo que necesita para formar y la dirección ve tendencias.
  • Un plazo de conservación de grabaciones y transcripciones, definido y aplicado.
  • El derecho de cada persona a ver sus propias sesiones.
Volver al índice

Si alguna de estas piezas describe tu caso, hablemos.

Te enseñamos cómo lo resolvemos en Fenix, con un caso parecido al tuyo.