Apa yang dimaksud fraud : Fraud is the crime of getting money by deceiving people.
Menyambung postingan terdahulu, bahwa aplikasi Benford hanya cocok untuk uji data yang sifatnya time serries, bagaimana jika data yang akan kita analisa terdiri dari banyak variable prediktor dan data target yang tidak balance.
Fraud data preparation
Kita akan ambil bahan dari dataset creditcard yang ada di Kaggle, terdiri 284315 observasi dan dicurigai ada 17% nya creditcard tsb kena fraud. Yang jadi masalah kita harus menentukan dari 17 % tersebut, berapa persenkah data yang benar-benar fraud atau hanya yang kelihatannya fraud saja.
Dimensi dataset
Dimensi dataset creditcard terdiri dari 284315 baris predictor, dan variable kolom 31, terdiri dari :
Variable Time dalah waktu dalam detik antara trasaksi pertama dan lainnya.
Variable V1 - V28, yang merupakan hasil dari transformasi PCA original data(rahasia).
Variable Amount adalah jumlah uang yang ditransfer.
Class berisi 1=fraud dan 0=bukan fraud
library(tidyverse)
# download from https://www.kaggle.com/dalpozz/creditcardfraud<- creditcard.csv="" div="" read.csv="">
table(creditcard$Class)
# 0 1
#284315 492
#492/284315=17%
# download from https://www.kaggle.com/dalpozz/creditcardfraud<- creditcard.csv="" div="" read.csv="">
table(creditcard$Class)
# 0 1
#284315 492
#492/284315=17%
creditcard
%>%
ggplot(aes(x = Class)) +
geom_bar(color = "grey", fill =
"lightgrey") +
theme_bw()






