Registro

AI Literacy: : How LLMs Work, Their Biases, and Their Operation

Rodríguez Joaquín, René Alexis

Literacidad en IA: Funcionamiento, Sesgos y Operatividad de los LLMs




Autores Rodríguez Joaquín, René Alexis

Tema AI literacy
Tema large language models
Tema tokenization
Tema algorithmic bias
Tema RLHF
Tema benchmarks
Tema corpus transparency
Tema literacidad en IA
Tema modelos grandes de lenguaje
Tema tokenización
Tema sesgo algorítmico
Tema RLHF
Tema benchmarks
Tema transparencia de datos

Descripción Los modelos grandes de lenguaje (LLMs) han pasado de objeto de la lingüística computacional a infraestructura cotidiana de la producción profesional, científica y administrativa. Este ensayo propone una literacidad en IA entendida como comprensión técnico-epistémica del artefacto LLM, organizada en tres ejes: cómo funciona, qué sesgos inscribe y qué operatividad responsable cabe esperar de su uso. Desde un paradigma cualitativo-interpretativo, se adopta un diseño de investigación documental con enfoque crítico-analítico, siguiendo el modelo de Bowen (2009), a partir de literatura primaria indexada en Web of Science, Scopus, Google Scholar, arXiv y la ACL Anthology entre 2017 y mayo de 2026, sobre arquitecturas transformer (Vaswani et al., 2017), tokenización (Petrov et al., 2023; Ahia et al., 2023), aprendizaje por refuerzo con retroalimentación humana (Ouyang et al., 2022; Casper et al., 2023), validez de constructo (Raji et al., 2021; Bowman y Dahl, 2021) y colonialidad de datos (Quijano, 2000; Couldry y Mejias, 2019). El análisis identifica tres operaciones técnicas centrales (tokenización, atención y predicción del siguiente token) cuyas decisiones de diseño penalizan al español frente al inglés con un premium de tokenización de 1,55 a 1 en GPT-3.5 y GPT-4; tres capas estructurales de inscripción de sesgos (corpus, alineamiento por RLHF y benchmarks) que invalidan la pretensión de neutralidad de los sistemas comerciales; una caída de la transparencia agregada de los modelos de fundación de 58 a 40,69 puntos sobre 100 entre 2024 y 2025; y una brecha de hasta 30,2 puntos porcentuales entre la mejor y la peor lengua en MMLU-ProX. Se concluye que la literacidad técnico-epistémica es condición necesaria para que la academia, los organismos públicos, el sector privado y el tercer sector latinoamericanos articulen políticas de IA situadas, transparentes y soberanas.
Descripción Large Language Models (LLMs) have moved from a specialized object of computational linguistics to a routine infrastructure for professional, scientific and administrative production. This essay proposes an AI literacy understood as the technical-epistemic comprehension of the LLM artifact, organized in three axes: how it works, what biases it inscribes, and what responsible operability can be expected from its use. From a qualitative-interpretive paradigm, a documentary research design with a critical-analytical approach is adopted, following Bowen’s (2009) model, drawing on primary literature indexed in Web of Science, Scopus, Google Scholar, arXiv and the ACL Anthology between 2017 and May 2026, on transformer architectures (Vaswani et al., 2017), tokenization (Petrov et al., 2023; Ahia et al., 2023), reinforcement learning from human feedback (Ouyang et al., 2022; Casper et al., 2023), construct validity (Raji et al., 2021; Bowman and Dahl, 2021), and data coloniality (Quijano, 2000; Couldry and Mejias, 2019). The analysis identifies three central technical operations (tokenization, attention and next-token prediction) whose design decisions penalize Spanish relative to English with a tokenization premium of 1.55 to 1 in GPT-3.5 and GPT-4; three structural layers of bias inscription (corpus, RLHF alignment and benchmarks) that invalidate the neutrality claim of commercial systems; a drop in aggregate transparency of foundation models from 58 to 40.69 points out of 100 between 2024 and 2025; and a gap of up to 30.2 percentage points between the best and worst languages in MMLU-ProX. The article concludes that technical-epistemic literacy is a necessary condition for Latin American academia, public bodies, private sector, and the third sector to articulate situated, transparent, and sovereign AI policies.

Editorial ISAE Universidad

Fecha 2026-07-27

Tipo info:eu-repo/semantics/article
Tipo info:eu-repo/semantics/publishedVersion
Tipo Artículo revisado por pares

Formato application/pdf
Formato text/html

Identificador http://revistas.isaeuniversidad.ac.pa/index.php/espila/article/view/159
Identificador 10.61454/yhetdk61

Fuente Espila; Vol. 8 Núm. 2 (2026): Espila; 118-133
Fuente Espectro Investigativo Latinoamericano; Vol. 8 No. 2 (2026): Espila; 118-133
Fuente 2710-7515
Fuente 10.61454/zwp9gj54

Idioma spa

Relación http://revistas.isaeuniversidad.ac.pa/index.php/espila/article/view/159/200
Relación http://revistas.isaeuniversidad.ac.pa/index.php/espila/article/view/159/236

Derechos Derechos de autor 2026 Espila
Derechos https://creativecommons.org/licenses/by-nc-sa/4.0