
La quantité toujours croissante d'informations sur le Web est organisée en données structurées, semi-structurées et non structurées. Les systèmes de classification de texte, capables de gérer des structures aussi différentes, peuvent faciliter le travail de tâches importantes telles que l'indexation et la récupération d'informations dans les moteurs de recherche. L'objectif de cette recherche est de développer une méthode de classification de documents en plusieurs catégories avec une logique floue. Cette méthode a été construite à partir d'un processus de reconnaissance de formes et, également, deux variables appelées similarité et exactitude ont été utilisées.La méthode de classification floue proposée utilise des variables qui expriment la capacité d'analyser la similarité et l'exactitude d'un document à travers une base de données de termes.La base de données de termes est générée par une collection de documents pré-classifiés dans des catégories d'intérêt.Les documents traités selon la similarité et l'exactitude dans la base de données de termes composent un ensemble de formation également appelé base de connaissances.À partir de cette base de données, il est possible d'identifier un modèle qui spécifie un ensemble de règles par un processus de découverte de connaissances.Ce processus implique l'exploration de données de la base de connaissances.Ainsi, il était possible définir un modèle général qui est utilisé dans la création des règles et des fonctions d'appartenance du modèle flou pour la classification des documents en plusieurs catégories. Le modèle général des règles identifiées dans le processus d'exploration de données et mis en œuvre dans le modèle flou considère les variables les plus significatives et contribue également à la spécification des fonctions d'appartenance, telles que la définition des termes linguistiques des ensembles flous. Ainsi, il a été possible de mettre en œuvre une approche plus déterministe concernant les fonctions d'entrée, d'appartenance et les règles d'inférence du modèle flou. Les résultats de la méthode proposée pour la classification des documents sont pertinents car ils ont un taux de précision satisfaisant.
La cantidad cada vez mayor de información en la Web se organiza en datos estructurados, semiestructurados y no estructurados. Los sistemas de clasificación de textos, capaces de manejar estructuras tan diferentes, pueden facilitar el trabajo de tareas importantes como la indexación y la recuperación de información en los motores de búsqueda. El objetivo de esta investigación es desarrollar un método para la clasificación de documentos en múltiples categorías con lógica difusa. Este método se construyó a partir de un proceso de reconocimiento de patrones y, también, Se utilizaron dos variables llamadas similitud y precisión. El método de clasificación difusa propuesto utiliza variables que expresan la capacidad de analizar la similitud y precisión de un documento a través de una base de datos de términos. La base de datos de términos es generada por una colección de documentos preclasificados en categorías de interés. Los documentos procesados de acuerdo con la similitud y precisión en la base de datos de términos componen un conjunto de entrenamiento también llamado base de conocimiento. A partir de esta base de datos, es posible identificar un patrón que especifica un conjunto de reglas a través de un proceso de descubrimiento de conocimiento. Este proceso implica la minería de datos de la base de conocimiento. Así, fue posible definir un modelo general que se utiliza en la creación de reglas y funciones de membresía del modelo difuso para la clasificación de documentos en múltiples categorías. El modelo general de las reglas identificadas en el proceso de minería de datos e implementadas en el modelo difuso considera las variables más significativas y también contribuye a la especificación de las funciones de membresía, como la definición de términos lingüísticos de conjuntos difusos. Así, fue posible implementar un enfoque más determinista con respecto a la entrada, las funciones de membresía y las reglas de inferencia del modelo difuso. Los resultados del método propuesto para la clasificación de documentos son relevantes porque tienen una tasa de precisión satisfactoria.
The ever-increasing amount of information on the Web is organized in structured, semi-structured and unstructured data.Text classification systems, capable of handling such different structures, may facilitate the work of important tasks such as indexation and information retrieval in search engines.The objective of this research is to develop a method for the classification of documents into multiple categories with fuzzy logic.This method was built from a process of pattern recognition and, also, two variables called similarity and accuracy were used.The proposed fuzzy classification method uses variables that express the ability to analyze the similarity and accuracy of a document through a database of terms.The database of terms is generated by a collection of pre-classified documents in categories of interest.The documents processed according to the similarity and accuracy in the database of terms composes a training set also called knowledge base.From this database, it is possible to identify a pattern that specifies a set of rules through a knowledge discovery process.This process involves the data mining of the knowledge base.Thus, it was possible to define a general model that is used in the creation of rules and membership functions of the fuzzy model for the classification of documents into multiple categories.The general model of the rules identified in the data mining process and implemented in fuzzy model considers the most significant variables and also contributes to the specification of the membership functions, such as the definition of linguistic terms of fuzzy sets.Thus, it was possible to implement a more deterministic approach regarding the input, membership functions and inference rules of the fuzzy model.The results of the proposed method for classification of documents are relevant because they have a satisfactory accuracy rate.
يتم تنظيم الكمية المتزايدة باستمرار من المعلومات على الويب في بيانات منظمة وشبه منظمة وغير منظمة. قد تسهل أنظمة تصنيف النص، القادرة على التعامل مع هذه الهياكل المختلفة، عمل المهام المهمة مثل الفهرسة واسترجاع المعلومات في محركات البحث. الهدف من هذا البحث هو تطوير طريقة لتصنيف المستندات إلى فئات متعددة بمنطق غامض. تم بناء هذه الطريقة من عملية التعرف على الأنماط، وكذلك، تم استخدام متغيرين يطلق عليهما التشابه والدقة. تستخدم طريقة التصنيف الغامضة المقترحة متغيرات تعبر عن القدرة على تحليل تشابه ودقة المستند من خلال قاعدة بيانات للمصطلحات. يتم إنشاء قاعدة بيانات للمصطلحات من خلال مجموعة من المستندات المصنفة مسبقًا في فئات الاهتمام. المستندات التي تتم معالجتها وفقًا للتشابه والدقة في قاعدة بيانات المصطلحات تؤلف مجموعة تدريب تسمى أيضًا قاعدة المعرفة. من قاعدة البيانات هذه، من الممكن تحديد نمط يحدد مجموعة من القواعد من خلال عملية اكتشاف المعرفة. تتضمن هذه العملية استخراج بيانات قاعدة المعرفة. وبالتالي، كان من الممكن لتحديد نموذج عام يتم استخدامه في إنشاء القواعد ووظائف العضوية للنموذج الغامض لتصنيف المستندات إلى فئات متعددة. يعتبر النموذج العام للقواعد المحددة في عملية استخراج البيانات والمنفذة في النموذج الغامض أهم المتغيرات ويساهم أيضًا في تحديد وظائف العضوية، مثل تعريف المصطلحات اللغوية للمجموعات الغامضة. وبالتالي، كان من الممكن تنفيذ نهج أكثر حتمية فيما يتعلق بالمدخلات ووظائف العضوية وقواعد الاستدلال للنموذج الغامض. نتائج الطريقة المقترحة لتصنيف المستندات ذات صلة لأنها تتمتع بمعدل دقة مرضٍ.
FOS: Computer and information sciences, Artificial intelligence, Set (abstract data type), Detection and Prevention of Phishing Attacks, Knowledge base, Database, Artificial Intelligence, Multi-label Text Classification in Machine Learning, Machine learning, Image (mathematics), Information retrieval, Similarity (geometry), Multi-label Learning, Text Classification, Data mining, Computer science, Process (computing), Programming language, Automatic Keyword Extraction from Textual Data, Fuzzy logic, Operating system, Computer Science, Physical Sciences, Information Retrieval, Fuzzy set, Document Categorization, Textual Data, Fuzzy classification, Information Systems
FOS: Computer and information sciences, Artificial intelligence, Set (abstract data type), Detection and Prevention of Phishing Attacks, Knowledge base, Database, Artificial Intelligence, Multi-label Text Classification in Machine Learning, Machine learning, Image (mathematics), Information retrieval, Similarity (geometry), Multi-label Learning, Text Classification, Data mining, Computer science, Process (computing), Programming language, Automatic Keyword Extraction from Textual Data, Fuzzy logic, Operating system, Computer Science, Physical Sciences, Information Retrieval, Fuzzy set, Document Categorization, Textual Data, Fuzzy classification, Information Systems
| selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | 3 | |
| popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network. | Average | |
| influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | Average | |
| impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network. | Average |
