
handle: 11441/155736
Este Trabajo de Fin de Máster (TFM) explora la evolución y la aplicación de los modelos de lenguaje a gran escala, con un enfoque particular en la cuarta iteración del modelo Generative Pre-trained Transformer (GPT-4) desarrollado por OpenAI. A través de un análisis teórico y matemático profundo, se examina cómo los avances en el Procesamiento del Lenguaje Natural (NLP), las Redes Neuronales Recurrentes (RNN), las Redes Neuronales Convolucionales (CNN), los Transformers, y la auto-atención han facilitado el desarrollo de modelos de lenguaje más sofisticados y precisos. Los conceptos matemáticos clave, como los espacios vectoriales, los embeddings, las funciones de activación, y las funciones de pérdida y optimización son explorados en detalle para proporcionar una comprensión más sólida de la complejidad computacional, la convergencia, la optimización, y la capacidad de generalización y aprendizaje de estos modelos. Este estudio también discute las medidas de rendimiento, la interpretabilidad y la explicabilidad de los modelos de lenguaje, así como las limitaciones inherentes de los enfoques matemáticos actuales. Este TFM también aborda las importantes cuestiones éticas y sociales que surgen con el uso de los modelos de lenguaje a gran escala, incluyendo el sesgo y la equidad, la privacidad y seguridad y la regulación de la Inteligencia Artificial (IA). Al proporcionar una visión crítica y un análisis exhaustivo de estos temas, este trabajo busca abrir nuevos caminos para la investigación futura en esta área en constante evolución y altamente relevante.
This Master’s Thesis delves into the evolution and application of large-scale language models, with a particular focus on the fourth iteration of the Generative Pre-trained Transformer (GPT-4) developed by OpenAI. Through a profound theoretical and mathematical analysis, it examines how advances in Natural Language Processing (NLP), Recurrent Neural Networks (RNN), Convolutional Neural Networks (CNN), Transformers, and selfattention have facilitated the development of more sophisticated and accurate language models. Key mathematical concepts such as vector spaces, embeddings, activation functions, and loss and optimization functions are explored in detail to provide a more robust understanding of the computational complexity, convergence, optimization, and the generalization and learning capacity of these models. This study also discusses performance metrics, the interpretability and explainability of language models, as well as the inherent limitations of current mathematical approaches. This thesis also addresses the critical ethical and societal issues that arise with the use of large-scale language models, including bias and fairness, privacy and security and AI regulation and governance. By providing critical insight and comprehensive analysis of these topics, this work seeks to pave the way for future research in this rapidly evolving and highly relevant field.
Universidad de Sevilla. Doble Máster Universitario en Profesorado de Educación Secundaria Obligatoria y Bachillerato, Formación Profesional y Enseñanza de Idiomas (MAES) y en Matemáticas (MUM))
Optimization, Computational Complexity, Generalization, Generalización, Modelos de Lenguaje, Self-attention, Redes Neuronales Convolucionales, Optimización, Deep Learning, Redes Neuronales Recurrentes, Transformers, Interpretability, Ética de la IA, Language Models, Auto-atención, Recurrent Neural Networks, Natural Language Processing, Aprendizaje Profundo, Interpretabilidad, Convolutional Neural Networks, AI Regulation, AI Ethics, Procesamiento del Lenguaje Natural, GPT-4, Complejidad Computacional, Regulación de la IA
Optimization, Computational Complexity, Generalization, Generalización, Modelos de Lenguaje, Self-attention, Redes Neuronales Convolucionales, Optimización, Deep Learning, Redes Neuronales Recurrentes, Transformers, Interpretability, Ética de la IA, Language Models, Auto-atención, Recurrent Neural Networks, Natural Language Processing, Aprendizaje Profundo, Interpretabilidad, Convolutional Neural Networks, AI Regulation, AI Ethics, Procesamiento del Lenguaje Natural, GPT-4, Complejidad Computacional, Regulación de la IA
| selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | 0 | |
| popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network. | Average | |
| influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | Average | |
| impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network. | Average |
