El Benchmark de la ORCA que suspende en cálculo a ChatGPT-5 y Claude Sonnet, y aprueba por los pelos a Gemini, Grok y DeepSeek
Muchas veces he hablado del problema que tiene la «Creatividad» en los LLMs. Esto hace que tengamos Hallucinaciones, Errores, Sesgos
Leer más