
Hệ thống quản trị đào tạo trực tuyến
Quy trình phân tích dữ liệu thường gồm các bước:
Thu thập dữ liệu
Làm sạch dữ liệu
Khám phá dữ liệu (Exploratory Data Analysis)
Phân tích dữ liệu
Trực quan hóa dữ liệu
Đưa ra kết luận
Dataset: sales_data.csv
Các cột dữ liệu:
| Cột dữ liệu | Ý nghĩa |
|---|---|
| Date | ngày bán hàng |
| Product | tên sản phẩm |
| Region | khu vực |
| Quantity | số lượng bán |
| Revenue | doanh thu |
import pandas as pd
df = pd.read_csv("sales_data.csv")
Xem dữ liệu:
df.head()
df.info()
Kiểm tra dữ liệu thiếu:
df.isnull().sum()
Ví dụ loại bỏ dữ liệu thiếu:
df = df.dropna()
Chuyển đổi kiểu dữ liệu:
df["Date"] = pd.to_datetime(df["Date"])
df.groupby("Product")["Revenue"].sum()
df.groupby("Region")["Revenue"].sum()
df["Quantity"].sum()
Biểu đồ cột:
import matplotlib.pyplot as plt
df.groupby("Product")["Revenue"].sum().plot(kind="bar")
plt.title("Revenue by Product")
plt.show()
Biểu đồ đường theo thời gian:
df.groupby("Date")["Revenue"].sum().plot()
plt.title("Revenue Over Time")
plt.show()
Sau khi phân tích dữ liệu, có thể rút ra:
sản phẩm bán chạy nhất
khu vực có doanh thu cao nhất
xu hướng doanh thu theo thời gian.
EDA là quá trình khám phá dữ liệu trước khi phân tích.
Các bước EDA thường gồm:
xem dữ liệu
kiểm tra dữ liệu thiếu
xem thống kê cơ bản
vẽ biểu đồ.
Phân tích dữ liệu giúp:
hỗ trợ ra quyết định
dự đoán xu hướng
cải thiện hiệu quả kinh doanh.
Import thư viện:
import pandas as pd
import matplotlib.pyplot as plt
Đọc dữ liệu:
df = pd.read_csv("sales_data.csv")
Kiểm tra dữ liệu:
df.info()
df.describe()
Làm sạch dữ liệu:
df = df.dropna()
Phân tích dữ liệu:
df.groupby("Product")["Revenue"].sum()
Vẽ biểu đồ:
df.groupby("Product")["Revenue"].sum().plot(kind="bar")