Modelos de lenguaje general fallan en planificación de medios: solo 50% de precisión
Estudio comparativo revela limitaciones críticas de IA genérica frente a plataformas especializadas en el sector publicitario
Los modelos de lenguaje grande (LLM) de propósito general presentan limitaciones significativas cuando se enfrentan a tareas de planificación de medios, según un análisis comparativo que evaluó su desempeño en ejercicios prácticos del sector. El estudio, que incluyó 35 casos de uso centrados en el mercado alemán, reveló que estos…

Los modelos de lenguaje grande (LLM) de propósito general presentan limitaciones significativas cuando se enfrentan a tareas de planificación de medios, según un análisis comparativo que evaluó su desempeño en ejercicios prácticos del sector. El estudio, que incluyó 35 casos de uso centrados en el mercado alemán, reveló que estos modelos alcanzan apenas el 50% de precisión en consultas sobre estrategia, análisis de audiencia y cálculos de métricas como alcance y GRP (Gross Rating Points).
Los resultados muestran disparidades notables entre diferentes plataformas. GPT-5 de OpenAI respondió correctamente 16 de 35 preguntas, equivalente a 45.7% de precisión, mientras que Claude Sonnet 4.5 de Anthropic obtuvo solo 6 respuestas correctas (17.1%). En contraste, plataformas especializadas desarrolladas internamente por agencias de medios demostraron mayor efectividad, alcanzando hasta 94.3% de precisión en los mismos ejercicios. Las pruebas incluyeron escenarios complejos como cálculos de alcance combinado en múltiples canales, donde los LLM estándar frecuentemente proporcionaban respuestas que, aunque sonaban convincentes, eran matemáticamente incorrectas.
Las debilidades identificadas en los modelos genéricos se concentran en la interpretación contextual de datos mediáticos y la falta de información actualizada sobre métricas de la industria. Los LLM no entrenados específicamente en planificación de medios carecen de la capacidad para distinguir entre conceptos como alcance neto y bruto, o para aplicar correctamente fórmulas de cálculo de audiencia acumulada. Esta brecha de precisión tiene implicaciones directas para los CMO y directores de medios: confiar en recomendaciones de IA genérica sin validación experta puede resultar en asignaciones de presupuesto ineficientes, cálculos de ROI inexactos y estrategias de cobertura deficientemente fundamentadas.
Para los CTO, el hallazgo subraya una realidad técnica: los LLM requieren entrenamiento especializado, datos actualizados y arquitecturas adaptadas al dominio para competir con sistemas construidos específicamente para un sector. La diferencia de casi 50 puntos porcentuales entre modelos genéricos y plataformas especializadas sugiere que la inversión en IA vertical—sistemas diseñados para tareas específicas de negocio—sigue siendo más confiable que depender de capacidades generales. Este patrón se replica en otros sectores: finanzas, legal y manufactura también reportan limitaciones similares cuando aplican LLM sin contexto sectorial.
Sigue leyendo
Analisis de mercadoMedición de audiencias digitales: la fragmentación de estándares amenaza inversión publicitaria
Analisis de mercadoAgentes de IA empresarial ganan ventaja con datos históricos integrados
Analisis de mercado