guia oficial
Miembro
- Desde
- 24 Abr 2026
- Mensajes
- 30
Acabo de publicar un artículo sobre algo que afecta a cualquiera que use IA: los benchmarks con los que comparamos modelos (MMLU, GSM8K, HumanEval...) se están contaminando y saturando, así que ese "95% de acierto" que presumen las empresas cada vez dice menos de lo que parece.
Lo escribí a raíz de una conferencia de esta semana de un investigador de referencia en IA responsable, y explico qué hay detrás del problema, cómo leer un ranking sin que te la cuelen y una prueba de diez minutos que puedes hacer tú mismo para saber si un modelo te sirve de verdad para tu trabajo.
https://topherramientaia.blogspot.com/2026/10/hasta-cuando-nos-enganaremos-con-los.html
Lo escribí a raíz de una conferencia de esta semana de un investigador de referencia en IA responsable, y explico qué hay detrás del problema, cómo leer un ranking sin que te la cuelen y una prueba de diez minutos que puedes hacer tú mismo para saber si un modelo te sirve de verdad para tu trabajo.