Big Data (Büyük Veri) Nedir?

Büyük Veri, hacim, hız ve çeşitlilik açısından geleneksel veri işleme yöntemleriyle yönetilmesi zor olan çok büyük ve karmaşık veri kümelerini ifade eder. Bu verilerden anlamlı bilgi üretmek için gelişmiş analitik, makine öğrenmesi ve dağıtık sistemler kullanılır.

  • Büyük Veri
Big Data (Büyük Veri) Nedir?
  1. Big Data Nedir?

İnternet ve sosyal medya kullanımının yaygınlaşmasının, bilgi kavramının karşılığını da etkilediğini söylemek yanlış olmaz. Bilgiyi pek çok insan için çok daha hızlı ve kolay ulaşılabilir kılan internet, aynı zamanda ortaya ciddi ölçüde bilgi kirliliğinin çıkmasına da neden oluyor. Keza bu nedenle, internet pek çok kullanıcı tarafından “bilgi çöplüğü” olarak da anılıyor.

Esasen “çöplük” olarak tanımlanan havuz, içinde milyonlarca veri barındıran bir kaynak olarak değerlendiriliyor. Kullanıcıların bir akış üzerinden ileterek bu havuza gönderdikleri verilerin işlenebilir ve mantıksal bir düzlem çerçevesinde değerlendirilebilir olan bölümü, bazı yazılım ve şirketler tarafından bir araya getiriliyor. Ortaya çıkan bu anlamlı veriler bütünü, Büyük Veri (Big Data) kavramını oluşturuyor. Böylece ortaya pek çok araştırma için kaynak sağlayabilecek, sınıflandırılmaya uygun ve saklanabilir bir veri topluluğu çıkıyor.

Big Data Nasıl Kullanılır?

Big Data, özellikle firmaların müşteri davranışlarını inceleyerek doğru kararlar almalarına ve stratejiler geliştirmelerine önemli katkılar sağlar. Eldeki veriler en sade ve işlenebilir hale getirildikten sonra, karşılaştırma yöntemi kullanılarak bu verilerin birbirleriyle olan ilişkileri incelenir ve aralarındaki bağlantılar ortaya çıkartılır. Bu sayede, alınacak olan kararların sonuçlarını önceden kestirmek mümkün olur. Verilerde yer alan çeşitli noktaların yerleri değiştirilerek oluşturulan simülasyonlarla, farklı kararlara verilecek tepkiler görülebilir.

Big Data analizi sayesinde kurumlar, gerçek müşteri davranışlarına dayalı verileri doğru bir şekilde değerlendirip, yüksek faydaya sahip bir araca dönüştürebilirler.

  1. Big Datanın Önemi

Big Data tamamen gerçek verilerin analizine dayandığı için maliyetleri düşürme, doğru kanallara reklam harcaması yapma, iş gücünden tasarruf sağlama ve beklentilere uygun ürün geliştirme gibi birçok farklı alanda doğru kararlar alınmasına olanak tanımaktadır. Büyük veri güçlü analizlerle birleştiğinde iş ile alakalı şunlar gerçekleştirilebilir:

  • Gerçek zamanlı hata ve sorunların temel nedenlerini belirleme.
  • Müşterilerin satın alma alışkanlıklarına dayanarak satış amaçlı kuponlar üretme.
  • Yeni portfolyoların risklerini tekrar hesaplama.
  • İşleyişi etkilemeden önce yanlış davranışları tespit etme.
  • Büyük verilerin önemi, sahip olduğunuz verinin ne olduğu, ne yaptığınızla ilgili değildir.
Big Data (Büyük Veri) Nedir? – görsel 2
  1. Big Datanın Kullanım Alanları

Big Data, başta bankacılık ve perakende sektörü gibi müşteri davranışlarının çok fazla önem taşıdığı ve takip edilmesinin gerektiği sektörler olmak üzere her alanda kullanılabilmektedir. Son yıllarda büyük verinin önemi devletler tarafından da anlaşılmış ve çeşitli alanlarda kullanılmaya başlanmıştır. Sağlık alanında; hastalıkların erken teşhis edilmesi ya da ilaç geliştirilmesi gibi konularda kullanılan büyük veri, suçları önlemek amacıyla ya da eğitim sisteminde geliştirmeler yapmak amacıyla da kullanılabilmektedir.

Big Data Bileşenleri Nelerdir?

Big Datanın 5 ana bileşen oluşturmaktadır.

  1. Çeşitlilik (Variety): Üretilen verilerin büyük bir kısmı, birbirinden farklı formata sahiptir. Telefonlardan, tabletlerden, bilgisayarlardan; farklı işletim sistemlerinden ya da dillerden gelen veriler birbirinden farklı formatların ortaya çıkmasına neden olmaktadır.
  2. Hız (Velocity): Gün geçtikçe artan teknolojik imkanlar, elde edilen veri miktarının, yapılacak işlem sayısının ve çeşitliliğinin de aynı şekilde artmasına neden olmaktadır.
  3. Hacim (Volume): Geçtiğimiz 10 yılda veri miktarı 40 kattan fazla bir artış göstermiş fakat veri depolama için yapılan harcamalar ise 1,5 kat artmıştır. Bu durum, elde edilen verinin doğru ve verimli şekilde depolanması için çok iyi bir kurgulama gerektiğini ortaya koymaktadır.
  4. Doğrulama (Verification): Verilerle ilgili son yıllarda öne çıkan bir diğer konu, veri güvenliği ve doğruluğu olmuştur. Elde edilen verilerin kimler tarafından ve hangi şartlarda görüntüleneceği, bu verilerin hangilerinin gizli kalması gerektiği konuları, üzerinde dikkatle çalışılması gereken konulardır.
  5. Değer (Value): Büyük veri ile ilgili en önemli bileşen, değerdir. Elde edilen ve işlenen veriler, kuruma değer kattığı sürece anlamlıdır. Bu nedenle, büyük verinin analizinin ve simülasyonlarının doğru şekilde kurgulanması ve büyük veriyi kullanan kuruma fayda sağlaması öncelikli olarak ele alınmalıdır. Büyük veri (big data) doğru kurgulandığı ve kullanıldığı takdirde, şirketlerin karar aşamalarında önemli faydalar sağlamakta ve şirketlere rekabet üstünlüğü sağlamaktadır. Bu durumun farkında olan şirketler; pazarlama, satış, üretim gibi birçok alanda büyük veriden faydalanmaktadırlar.
  1. Big Datanın Çalışması İçin Üç Yöntem

Strateji 1: Örnek ve Model

Big Data (Büyük Veri) Nedir? – görsel 3

Örneklemek ve modellemek için, verilerimizi tümüyle kolayca indirilebilecek bir boyuta küçültürüz ve örnek üzerinde bir model oluştururuz. Binlerce, hatta yüzbinlerce veri noktasına alt örnekleme, model çalışma sürelerini de istatistiksel geçerliliğini korurken mümkün kılar.

Sınıf dengesini korumak gerekiyorsa (veya bir sınıfın fazla / az örneklenmesi gerekiyorsa), örnekleme sırasında veri kümesini sınıflandırmak oldukça basittir.

Avantajları

Hız: Tüm veri kümemiz üzerinde çalışmaya kıyasla, sadece bir örnek üzerinden çalışmak; çalışma sürelerini önemli ölçüde azaltabilir ve yineleme hızını artırabilir.

Prototipleme (İlk örnekleme): Sonunda modelimizi tüm veri kümesinde çalıştırmak zorunda kalsak bile, bu hiperparametreleri hassaslaştırmak ; modelimiz için iyi bir yol olabilir.

Paketler: Normal bir bellek içi veri kümesi üzerinde çalıştığımızdan, istediğimiz tüm R paketlerini kullanabiliriz.

Dezavantajları

Örnekleme: Alt örnekleme zor değildir, ancak geçerli olduğundan ve orijinal veri kümesinden yeterli sayıda nokta aldığımızdan emin olmak için dikkatle yapılması gerekir.

Ölçekleme: Daha sonra tam veri kümesinde çalıştırılacak bir şeyi prototiplemek için örnek ve model kullanıyorsak, prototip sürümümüzü tekrar tam veriye ölçeklendirmek için bir stratejimiz olması gerekir (veriyi hesaplamaya itmek gibi)

Toplam: İş Zekası (BI) görevleri, bir aydaki tüm satışların sayısı gibi, toplamlar hakkındaki soruları sık sık yanıtlar. Diğer stratejilerden biri, bu durumda genellikle daha iyi bir seçimdir.

Strateji 2: MapReduce

Big Data (Büyük Veri) Nedir? – görsel 4

Bu stratejide, veriler ayrılabilir birimlere yığınlanır ve her yığın ayrı ayrı çekilir ve seri, paralel veya yeniden birleştirmeden sonra çalıştırırız. Bu strateji kavramsal olarak MapReduce algoritmasına benzer. Eldeki işe bağlı olarak, parçalar zaman periyotları, coğrafi birimler veya ayrı işletmeler, departmanlar, ürünler veya müşteri segmentleri gibi mantıklı olabilir.

Avantajları

Tam veri kümesi: Veri kümesinin tamamını kullanırız.

Paralelleştirme: Eğer parçaları ayrı ayrı çalıştırırsak, sorunu kapsamlı bir şekilde paralel olarak ele alabiliriz ve çalışma zamanlarını hızlandırmak için paralelleştirmeyi kullanırız.

Dezavantajları

Gerekli Parçalar: Veri ve yığının uygun olması için ayrılabilir parçalara sahip olmamız gerekir.

Tüm Verileri Çekmek: Belleğin yoğun olabileceği durumlarda tüm verierimizi çekmek zorunda kalırız.

Eski Veriler: Yerel makinemize bir sürüm kaydettiğimizden, güncel kalması için verilerimizin periyodik olarak yenilenmesi gerekebilir.

Strateji 3: Hesaplamayı Verilere Aktarma

Big Data (Büyük Veri) Nedir? – görsel 5

Bu stratejide, verileri veritabanında sıkıştırırız ve yalnızca sıkıştırılmış veri kümesi veritabanından R‘a taşınır. Verileri R‘a çekmeden önce veritabanında özetleme veya filtreleme yaparak hızlandırmalar elde etmemiz genellikle mümkündür.

Bazen, dbplot ile histogram ve raster haritalarını hesaplama, modeldb ile bir model oluşturma ve tidypredict ile makine öğrenme modellerinden tahminler oluşturma gibi daha karmaşık işlemler de mümkündür.

Avantajları

Veritabanını Kullanma: En iyi veritabanlarının avantajlarından yararlanırız. (Bir sorguyu temel alarak verileri hızlı bir şekilde özetleme ve filtreleme gibi.)

Daha Fazla Bilgi, Daha Az Aktarım: Verileri tekrar R‘a çekmeden önce sıkıştırarak, tüm veri kümesini kullanırız. Ancak aktarım süreleri tüm veri kümesini taşımaktan çok daha azdır.

Dezavantajları

Veritabanı İşlemleri: Hangi veritabanını kullandığımıza bağlı olarak, bazı işlemler desteklenmiyor olabilir.

Veritabanı Hızı: Bazı bağlamlarda, veri analizi için sınırlayıcı faktör veritabanının hızıdır ve bu nedenle veritabanına daha fazla iş eklemek analistlerin yapmak istediği son şeydir.

  1. What Is Big Data?

It would not be wrong to say that the spread of the internet and social media has also changed what we mean by information. While the internet makes information far faster and easier to reach for many people, it also creates a serious amount of information pollution. For this reason, many users even call the internet an “information dump”.

The pool described as a “dump” is in fact seen as a source holding millions of pieces of data. The part of the data that users send to this pool through a stream and that can be processed and evaluated within a logical framework is brought together by certain software and companies. This meaningful body of data forms the concept of Big Data. The result is a classifiable, storable collection of data that can serve as a source for many kinds of research.

How Is Big Data Used?

Big Data makes an important contribution, especially by helping companies make the right decisions and develop strategies by studying customer behavior. Once the available data has been simplified and made processable, the relationships within the data are examined through comparison and the connections between them are revealed. This makes it possible to anticipate the results of decisions in advance. With simulations created by changing various points in the data, the reactions to different decisions can be observed.

Big Data analysis enables organizations to accurately evaluate data based on real customer behavior and turn it into a highly valuable tool.

  1. Why Big Data Matters

Because Big Data relies entirely on the analysis of real data, it enables sound decisions in many areas, such as reducing costs, spending on advertising in the right channels, saving labor and developing products that meet expectations. When big data is combined with powerful analytics, businesses can:

  • Identify the root causes of failures and issues in real time.
  • Generate sales coupons based on customers' buying habits.
  • Recalculate the risks of new portfolios.
  • Detect wrong behavior before it affects operations.
  • The importance of big data does not lie in how much data you have, but in what you do with it.
What Is Big Data? – image 2
  1. Where Big Data Is Used

Big Data can be used in every field, especially in sectors such as banking and retail, where customer behavior is very important and must be tracked. In recent years, governments have also recognized the importance of big data and started using it in various areas. In healthcare it is used for early diagnosis of diseases and for drug development, and it can also be used to prevent crime or to improve the education system.

What Are the Components of Big Data?

Big Data consists of 5 main components.

  1. Variety: Much of the data produced comes in different formats. Data from phones, tablets and computers, and from different operating systems or languages, leads to many different formats.
  2. Velocity: Ever-growing technological capabilities increase the amount of data collected, as well as the number and variety of operations performed on it.
  3. Volume: Over the past 10 years, the amount of data has grown more than 40-fold, while spending on data storage has grown only 1.5-fold. This shows that storing data accurately and efficiently requires very careful planning.
  4. Verification: Another topic that has come to the fore in recent years is data security and accuracy. Who can view the collected data and under what conditions, and which data must remain confidential, are issues that need careful attention.
  5. Value: The most important component of big data is value. Collected and processed data is only meaningful as long as it adds value to the organization. For this reason, designing big data analyses and simulations correctly, so that they benefit the organization using them, should be a priority. When big data is designed and used correctly, it brings important benefits to companies' decision-making and gives them a competitive advantage. Companies aware of this benefit from big data in many areas such as marketing, sales and production.
  1. Three Strategies for Working with Big Data

Strategy 1: Sample and Model

What Is Big Data? – image 3

To sample and model, we shrink our data to a size that can easily be downloaded in full and build a model on the sample. Subsampling to thousands, or even hundreds of thousands, of data points keeps model run times feasible while preserving statistical validity.

If class balance needs to be preserved (or a class needs to be over- or under-sampled), it is fairly simple to stratify the data set while sampling.

Advantages

Speed: Compared with working on the entire data set, working on just a sample can significantly reduce run times and increase iteration speed.

Prototyping: Even if we eventually have to run the model on the full data set, this can be a good way to fine-tune the hyperparameters of our model.

Packages: Because we are working on a normal in-memory data set, we can use any R packages we like.

Disadvantages

Sampling: Subsampling is not difficult, but it must be done carefully to make sure it is valid and that we take enough points from the original data set.

Scaling: If we use sample and model to prototype something that will later run on the full data set, we need a strategy for scaling our prototype back up to the full data (such as pushing computation to the data).

Totals: Business intelligence (BI) tasks often answer questions about totals, such as the number of all sales in a month. One of the other strategies is usually a better choice in this case.

Strategy 2: MapReduce

What Is Big Data? – image 4

In this strategy, the data is split into separable chunks, each chunk is pulled separately, and we run the work serially, in parallel, or after recombining the results. This strategy is conceptually similar to the MapReduce algorithm. Depending on the task at hand, the chunks might be time periods, geographic units, or logical groupings such as separate businesses, departments, products or customer segments.

Advantages

Full data set: We use the entire data set.

Parallelization: If we run the chunks separately, the problem becomes embarrassingly parallel, and we can use parallelization to speed up run times.

Disadvantages

Chunks Required: We need the data to have separable chunks suitable for this approach.

Pulling All the Data: We may have to pull all of our data, even when memory is constrained.

Stale Data: Since we save a copy on our local machine, the data may need to be refreshed periodically to stay current.

Strategy 3: Push Compute to the Data

What Is Big Data? – image 5

In this strategy, we compress the data inside the database, and only the compressed data set is moved from the database into R. It is usually possible to gain speed by summarizing or filtering in the database before pulling data into R.

Sometimes more complex operations are also possible, such as computing histograms and raster maps with dbplot, building a model with modeldb, and generating predictions from machine learning models with tidypredict.

Advantages

Using the Database: We take advantage of what databases do best (such as quickly summarizing and filtering data based on a query).

More Information, Less Transfer: By compressing the data before pulling it back into R, we still use the full data set, but transfer times are far shorter than moving the entire data set.

Disadvantages

Database Operations: Depending on which database we use, some operations may not be supported.

Database Speed: In some contexts, the limiting factor for data analysis is the speed of the database, so adding more work to the database is the last thing analysts want to do.