Алгоритм репрезентативного сэмплинга для систем баз данных на основе фрагментного параллелизма

Name: Алгоритм репрезентативного сэмплинга для систем баз данных на основе фрагментного параллелизма
Keywords: репрезентптивный сэмплинг, parallel database systems, representative samplin, репререляционные базы данных, relational databases, УДК 004.65, реляционные базы данных, ГРНТИ 50.41, параллельные системы баз данных, УДК 004.622

Yantsen, D. D.; Zymbler, M. L.

Found an issue? Give us feedback

South Ural State Uni...arrow_drop_down

South Ural State University Repository (Электронный архив ЮУрГУ)

Article . 2014

Data sources: South Ural State University Repository (Электронный архив ЮУрГУ)

Алгоритм репрезентативного сэмплинга для систем баз данных на основе фрагментного параллелизма

descriptionPublicationkeyboard_double_arrow_right Article 01 Jan 2014 Russian Federation Publisher:Издательский центр ЮУрГУ

Authors: Yantsen, D. D.; Zymbler, M. L.;

Алгоритм репрезентативного сэмплинга для систем баз данных на основе фрагментного параллелизма

- Summary
- Subjects
- Metrics

Abstract

Сэмплинг является популярным подходом к обработке сверхбольших баз данных в широком спектре приложений, связанных с интеллектуальным анализом данных, построением гистограмм, приблизительное исполнение запросов и др. Использование сэмпла вместо оригинальной базы данных может уменьшить точность результатов, но компенсируется сокращением времени выполнения обработки. Репрезентативный сэмплинг позволяет сохранить в сэмпле определенные характеристики базы данных. Однако существующие алгоритмы репрезентативного сэмплинга не могут быть применены для параллельных систем баз данных, поскольку не учитывают характеристики данных, распределяемых по вычислительным узлам кластерной системы. В данной статье предлагается алгоритм репрезентативного сэмплинга для параллельных реляционных систем баз данных на основе фрагментного параллелизма. Приведены результаты вычислительных экспериментов над предложенным алгоритмом, показавшие адекватное сохранение репрезентативности свойств базы данных, распределенной по узлам кластерной системы. Sampling is a popular approach to very large databases processing in a wide range of applications, e.g. data mining, histograms construction, query execution cost estimation, etc. Use of either the sample instead of the original database can reduce the accuracy of the results, but offset by a reduction of time executing processing. Representative sampling allows you to save the sample of certain characteristics of the database. However, existing algorithms for representative sampling can not be used for pas-parallel database systems because it does not take into account the characteristics of the data distribution fissionable by the compute nodes of the cluster system. In this paper we propose al-representative sampling algorithm for parallel relational database systems based on the slice of parallelism. The results of computational experiments on the proposed algorithm, showing adequate maintenance of representativity database properties distributed across the nodes of a cluster system. Янцен Дмитрий Дмитриевич, магистрант кафедры системного программирования Южно-Уральского государственного университета (Челябинск, Российская Федерация), d.yantsen@gmail.com. Цымблер Михаил Леонидович, к.ф.-м.н., доцент кафедры системного программирования Южно-Уральского государственного университета (Челябинск, Российская Федерация), mzym@susu.ru. D.D. Yantsen, South Ural State University (Chelyabinsk, Russian Federation), M.L. Zymbler, South Ural State University (Chelyabinsk, Russian Federation

Country

Russian Federation

Related Organizations

South Ural State University (Южно-Уральский государственный университет)
Russian Federation

Keywords

репрезентптивный сэмплинг, parallel database systems, representative samplin, репререляционные базы данных, relational databases, УДК 004.65, реляционные базы данных, ГРНТИ 50.41, параллельные системы баз данных, УДК 004.622

Impact byBIP!

	selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).	0
	popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network.	Average
	influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).	Average
	impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network.	Average

Found an issue? Give us feedback

0

Average

Green