Anthropic - Medición del sesgo político en Claude - Equanimidad 94-95% - Método Paired Prompts - Evaluación de código abierto - Character training - Comparación de 6 modelos - System prompt de neutralidad - GitHub
Benchmarking de IA más allá de los tests estándar - Entrevistar a modelos de IA para casos de uso específicos - Jagged Frontier - OpenAI GDPval - Vibes frente a mediciones reales - Ejemplo GuacaDrone - Ethan Mollick - One Useful Thing