Ứng dụng Khoa học Dữ liệu (Data Science) và Trí tuệ Nhân tạo (AI) trong Nông nghiệp Thông minh (Smart Agriculture) đang tạo nên một cuộc cách mạng thực sự. Tại Việt Nam, việc thực hiện dự đoán năng suất sữa bò bằng Data Science cho các đại trang trại quy mô hàng chục nghìn con đòi hỏi sự hỗ trợ đắc lực từ bài toán phân tích Big Data.
Trong buổi báo cáo đồ án khóa học Data Science tại COLE, học viên là Trưởng phòng Công nghệ Thông tin tại cụm trang trại bò sữa TH True Milk Nghĩa Đàn (Nghệ An) – thuộc Tập đoàn TH – đã trình bày đề tài ứng dụng dự đoán năng suất sữa bò bằng Data Science để phân tích tác động của thời tiết (nhiệt độ, độ ẩm) và lượng thức ăn tới sản lượng thực tế. Đây là minh chứng rõ nét cho việc kết hợp giữa công nghệ hiện đại và chuyên môn chăn nuôi thực tế.
THÔNG TIN HỌC VIÊN
Phan Tất Thắng
Data Science - K02- Hoàn thành: 12/08/2026
- Thời gian thực hiện: 14 ngày
- Ngành nghề: Trưởng phòng CNTT (TH Group)
- Kinh nghiệm: 28 năm làm IT
- Công ty: TH True Milk Nghệ An
FEEDBACK CỦA HỌC VIÊN
“Khoa học dữ liệu đã giúp tôi có công cụ trực quan hóa chính xác các tác động của yếu tố thời tiết tới sức khỏe đàn bò. Từ dữ liệu Big Data của trang trại, hệ thống dự đoán chính xác lượng sữa theo thời tiết.”
Lượng hóa được mức độ ảnh hưởng của hiện tượng Stress nhiệt (Heat Stress) và kiểm chứng mô hình Hồi quy tuyến tính trên dữ liệu thực tế.
1. BÀI TOÁN PHÂN TÍCH DỮ LIỆU TẠI TRANG TRẠI BÒ SỮA TH TRUE MILK
Với quy mô riêng tại Nghệ An lên tới hơn 50.000 con bò, khối lượng dữ liệu thu thập được hàng ngày là cực kỳ khổng lồ. Việc phân tích kho dữ liệu này đóng vai trò sống còn giúp Ban quản lý đưa ra các quyết định chính xác nhằm nâng cao sản lượng sữa trên từng con bò, đồng thời làm cơ sở so sánh hiệu quả vận hành giữa các trang trại trên toàn quốc (như Phú Yên, An Giang, Cao Bằng, Đà Lạt...).
Mục tiêu cốt lõi của bài toán dự đoán năng suất sữa bò bằng Data Science là tìm ra mối quan hệ giữa các yếu tố môi trường (Nhiệt độ, Độ ẩm), Dinh dưỡng (Lượng thức ăn tiêu thụ) đến Năng suất sữa trung bình. Qua đó, trang trại có thể tiên đoán trước sản lượng theo mùa và chủ động đưa ra giải pháp kỹ thuật (như thông gió, phun sương làm mát, điều chỉnh khẩu phần ăn).
- Yếu tố Môi trường: Thu thập dữ liệu cảm biến tự động về Nhiệt độ trung bình và Độ ẩm trung bình theo ngày tại khu vực chuồng nuôi.
- Chế độ Dinh dưỡng: Ghi nhận lượng thu thập thức ăn trung bình cùng thời điểm được cấp cho đàn bò để theo dõi sức ăn thực tế.
- Năng suất Sữa (Biến mục tiêu/Target): Sản lượng sữa trung bình thực tế thu hoạch, phân biệt rõ giữa tổng đàn bò và đàn bò đang trong chu kỳ vắt sữa.
2. CHI TIẾT QUY TRÌNH XỬ LÝ DỮ LIỆU & HƯỚNG DẪN CODE PYTHON
Trong video báo cáo, tác giả đã trình bày chi tiết từng bước xây dựng bài toán dự đoán năng suất sữa bò bằng Data Science chuẩn chỉnh bằng ngôn ngữ Python:
2.1. Khai báo thư viện và kết nối dữ liệu
Chương trình khởi tạo với việc khai báo các thư viện phân tích dữ liệu và học máy quen thuộc trong Python. Dữ liệu sau đó được kết nối và nạp vào tập dữ liệu (DataFrame).
# 1. Khai báo các thư viện hỗ trợ phân tích và mô hình hóa
import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
import seaborn as sns
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error, r2_score
# 2. Kết nối và đọc file dữ liệu từ trang trại
df = pd.read_csv('th_farm_milk_production.csv')
2.2. Khám phá và làm sạch dữ liệu (Data Cleaning)
- Cấu trúc cột dữ liệu: Dữ liệu chứa các cột thông tin chính bao gồm Nhiệt độ trung bình, Độ ẩm trung bình, Sản lượng sữa trung bình trên toàn đàn và Sản lượng sữa trung bình trên số lượng bò vắt sữa thực tế. Bò sữa có chu kỳ khai thác (thường vắt 8 tháng rồi dừng nghỉ - bò khô sữa), do đó số liệu trên đầu bò vắt sữa sẽ phản ánh chính xác năng suất hơn.
- Kiểm tra dữ liệu trống và trùng lặp: Do dữ liệu được ghi nhận tự động bằng thiết bị cảm biến chuyên dụng tại trang trại, kết quả kiểm tra cho thấy dữ liệu rất sạch và không chứa giá trị bị khuyết.
- Xử lý giá trị ngoại lệ (Outlier): Khi trực quan hóa bằng biểu đồ hộp (Boxplot), tác giả phát hiện một số giá trị ngoại lệ ở chỉ số độ ẩm (Humidity) bị kéo xuống thấp. Tác giả giải thích đây là do thao tác chuẩn hóa băm giảm dữ liệu trước khi trích xuất ra bên ngoài xử lý, đảm bảo dữ liệu gốc đo đạc thực tế vẫn hoàn toàn chính xác.
# Kiểm tra tổng quan dữ liệu và giá trị khuyết
print(df.info())
print(df.isnull().sum())
# Kiểm tra dữ liệu trùng lặp
print("Số dòng trùng lặp:", df.duplicated().sum())
# Vẽ biểu đồ Boxplot kiểm tra Outlier cho độ ẩm
plt.figure(figsize=(8, 4))
sns.boxplot(x=df['humidity'])
plt.title('Kiểm tra Outliers của Độ ẩm')
plt.show()

2.3. Phân tích tương quan và Trực quan hóa dữ liệu (EDA)
Thông qua việc vẽ biểu đồ xu hướng và quan hệ giữa các biến, tác giả rút ra những kết luận thực tế rất quan trọng phục vụ mô hình dự đoán năng suất sữa bò bằng Data Science:
- Nhiệt độ tương quan với Năng suất sữa: Tương quan nghịch rõ rệt. Khi nhiệt độ môi trường tăng cao, bò bị rơi vào trạng thái Stress nhiệt (Heat Stress). Lúc này bò sẽ ăn ít đi và dẫn đến sản lượng sữa bị giảm mạnh.
- Độ ẩm tương quan với Năng suất sữa: Tương quan thuận. Khi độ ẩm kết hợp nhiệt độ phù hợp làm không khí mát mẻ hơn, sức khỏe đàn bò tốt hơn và năng suất sữa tăng lên. Điều này chứng minh tính đúng đắn của việc trang trại phải bật hệ thống phun sương và quạt thông gió công suất lớn vào mùa hè.
- Lượng thức ăn tương quan với Năng suất sữa: Bò ăn nhiều thức ăn hơn sẽ cho sản lượng sữa cao hơn. Tuy nhiên, lượng ăn này lại phụ thuộc trực tiếp vào thời tiết (mùa hè nóng nực bò sẽ giảm ăn).
“Sản lượng sữa bao giờ cũng phụ thuộc vào nhiệt độ. Nhiệt độ càng cao thì sữa càng xuống. Ngược lại khi được làm mát, độ ẩm phù hợp thì lượng sữa tăng lên. Phân tích dữ liệu thực tế đã chứng minh hoàn toàn đúng với lý thuyết chăn nuôi.”
— Trưởng phòng CNTT - Phan Tất Thắng - Cụm trang trại TH True Milk Nghệ An
3. XÂY DỰNG & SO SÁNH CÁC MÔ HÌNH MACHINE LEARNING DỰ ĐOÁN
Tác giả đã thử nghiệm xây dựng 2 mô hình học máy trên Python nhằm dự đoán năng suất sữa bò bằng Data Science dựa theo các yếu tố đầu vào:
# Tách biến độc lập (X) và biến mục tiêu (y)
X = df[['temperature', 'humidity', 'feed_intake']]
y = df['milk_yield']
# Chia tập dữ liệu Train / Test (80% train, 20% test)
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# Mô hình 1: Hồi quy tuyến tính (Linear Regression)
lr_model = LinearRegression()
lr_model.fit(X_train, y_train)
y_pred_lr = lr_model.predict(X_test)
# Mô hình 2: Random Forest Regressor
rf_model = RandomForestRegressor(n_estimators=700, random_state=42)
rf_model.fit(X_train, y_train)
y_pred_rf = rf_model.predict(X_test)
| Chỉ số đánh giá | Mô hình Hồi quy tuyến tính (Linear Regression) | Mô hình Random Forest Regressor (700 trees) |
|---|---|---|
| Độ chính xác R-squared (R2) | Khoảng 65.9% - 67.7% | Khoảng 51.0% - 57.0% |
| Đánh giá xu hướng | Thể hiện đúng mối quan hệ tuyến tính giữa thời tiết và sản lượng sữa. | Hiệu năng thấp hơn do lượng mẫu dữ liệu chưa đủ lớn cho mô hình cây. |
| Mức độ phù hợp | Rất cao, phù hợp đưa vào dự báo trực tiếp. | Cần bổ sung thêm dữ liệu và tối ưu lại thông số. |

Góp ý chuyên sâu từ Giảng viên Data Science:
- Lý giải nguyên nhân Linear Regression vượt trội: Bản chất dữ liệu năng suất sữa theo thời tiết thể hiện mối quan hệ tuyến tính rất mạnh. Đối với dữ liệu mang tính tuyến tính cao và dung lượng mẫu vừa phải, các mô hình đơn giản như Linear Regression sẽ phát huy hiệu quả vượt trội hơn so với các mô hình phức tạp dạng cây như Random Forest.
- Kiểm tra giả định Hồi quy tuyến tính (Linear Assumptions): Giảng viên khuyên tác giả nên kiểm tra thêm các điều kiện tiên quyết của mô hình Linear Regression như: Phân bố chuẩn của phần dư (Residuals Normality) và Phương sai sai số không đổi (Homoscedasticity).
- Tối ưu siêu tham số với GridSearch CVR: Đối với Random Forest, thay vì chọn thủ công 700 cây, tác giả nên dùng phương pháp tìm kiếm lưới (GridSearchCV) để tự động tìm bộ siêu tham số tối ưu nhất.
# Hướng dẫn của giảng viên: Sử dụng GridSearchCV để tối ưu Random Forest
from sklearn.model_selection import GridSearchCV
param_grid = {
'n_estimators': [100, 200, 300],
'max_depth': [10, 20, None],
'min_samples_split': [2, 5, 10]
}
grid_search = GridSearchCV(estimator=RandomForestRegressor(random_state=42),
param_grid=param_grid,
cv=5,
scoring='r2')
grid_search.fit(X_train, y_train)
print("Bộ thông số tốt nhất:", grid_search.best_params_)
4. Ý NGHĨA THỰC TIỄN & KHẢ NĂNG ỨNG DỤNG TRONG DOANH NGHIỆP
Đồ án không chỉ dừng lại ở mức độ lý thuyết mà đã tạo ra một sản phẩm Video Demo hệ thống tự động trực quan. Nhờ mô hình dự đoán năng suất sữa bò bằng Data Science này, Ban giám đốc và các kỹ sư chăn nuôi tại TH True Milk có thể:
- Tiên đoán trước sản lượng sữa thu hoạch khi nhận thông báo dự báo thời tiết (ví dụ: đợt nắng nóng kéo dài vào mùa hè).
- Chủ động tính toán chi phí vận hành hệ thống quạt mát, phun sương làm mát chuồng trại để bù đắp giảm thiểu hiện tượng Stress nhiệt ở bò.
- Lên kế hoạch chuẩn bị và điều chỉnh lượng thức ăn tinh, thức ăn thô xanh phù hợp theo từng giai đoạn thời tiết.
Bài báo cáo từ Trưởng phòng CNTT TH True Milk là minh chứng rõ nhất cho thấy: Bất kể bạn ở độ tuổi nào, đến từ ngành nghề nào, triển khai bài toán dự đoán năng suất sữa bò bằng Data Science nói riêng và phân tích dữ liệu nói chung luôn là công cụ đắc lực giúp nâng tầm tư duy và giải quyết trực tiếp các bài toán thực tế của doanh nghiệp.
5. CÁC CÂU HỎI THƯỜNG GẶP (FAQ)
Câu hỏi 1: Tại sao việc phân biệt giữa tổng đàn bò và đàn bò vắt sữa lại quan trọng khi xây dựng mô hình dự đoán năng suất sữa bò bằng Data Science?
Trả lời: Bò sữa hoạt động theo chu kỳ sinh học (thường vắt sữa khoảng 8-10 tháng rồi nghỉ vắt để chuẩn bị sinh lứa tiếp theo - gọi là bò khô sữa). Nếu lấy tổng đàn làm mẫu số chia trung bình, chỉ số năng suất sẽ bị nhiễu do biến động số lượng bò khô sữa. Việc chia năng suất trên số bò thực tế vắt sữa giúp dữ liệu phản ánh chính xác hiệu suất sinh học và tác động thực sự của môi trường.
Câu hỏi 2: Yếu tố Stress nhiệt (Heat Stress) ảnh hưởng trực tiếp thế nào đến kết quả dự đoán năng suất sữa bò bằng Data Science?
Trả lời: Bò sữa là loài động vật ôn đới, rất nhạy cảm với nhiệt độ cao. Khi nhiệt độ tăng quá ngưỡng thoải mái (thường trên 25-27°C kèm độ ẩm cao), bò rơi vào trạng thái Stress nhiệt, mệt mỏi và giảm ăn. Dữ liệu thực tế chứng minh nhiệt độ tăng nghịch biến với năng suất sữa. Mô hình Data Science giúp lượng hóa chính xác 1°C tăng thêm sẽ làm giảm bao nhiêu lít sữa/ngày.
Câu hỏi 3: Vì sao trong bài toán này mô hình Linear Regression lại cho kết quả tốt hơn mô hình học máy phức tạp như Random Forest?
Trả lời: Trong Data Science, không phải mô hình càng phức tạp thì kết quả càng tốt. Mối quan hệ giữa thời tiết (nhiệt độ, độ ẩm) và năng suất sữa về bản chất mang tính tuyến tính rất rõ ràng. Với kích thước tập dữ liệu vừa phải (vài trăm đến vài nghìn dòng), mô hình Linear Regression học được xu hướng tổng thể rất chuẩn xác mà không bị hiện tượng học vẹt (Overfitting) như Random Forest.
Câu hỏi 4: Có thể ứng dụng mô hình dự đoán năng suất sữa bò bằng Data Science này cho các trang trại bò quy mô nhỏ không?
Trả lời: Hoàn toàn có thể. Tuy nhiên, các trang trại nhỏ cần lưu ý thiết lập các thiết bị cảm biến ghi nhận nhiệt độ, độ ẩm và sổ theo dõi sản lượng sữa hàng ngày một cách chuẩn hóa. Khi có tối thiểu 6-12 tháng dữ liệu liên tục, mô hình có thể bắt đầu dự đoán với độ chính xác tương đối.
Câu hỏi 5: Làm sao để tiếp tục cải thiện độ chính xác của mô hình dự đoán năng suất sữa bò bằng Data Science trong tương lai?
Trả lời: Để nâng cao chỉ số R2, trang trại có thể bổ sung thêm các biến đầu vào quan trọng khác như: Tuổi bò/Số lứa đẻ (Parity), Chỉ số thời tiết kết hợp THI (Temperature Humidity Index), Giống bò, Chỉ số sức khỏe/Bệnh tật (như viêm vú), và Dữ liệu vận động từ đeo thẻ chip thông minh.
NHẬN XÉT TỪ GIẢNG VIÊN
Đặng Lê Quang
AI Engineer & Data ScientistGiảng viên tại Cole.vn
“Bài đồ án triển khai thực tế rất ấn tượng. Học viên thể hiện tư duy phân tích miền bài toán (domain knowledge) cực kỳ sâu sắc khi lý giải các mối quan hệ sinh học và thời tiết.”
ĐÁNH GIÁ BÀI LÀM
| Hiểu bài toán & đặt vấn đề | ★★★★★ |
| Xử lý & làm sạch dữ liệu IoT | ★★★★★ |
| Trực quan hóa & EDA | ★★★★★ |
| Mô hình hóa Machine Learning | ★★★★ |
| Ứng dụng thực tiễn doanh nghiệp | ★★★★★ |
ĐỊNH HƯỚNG PHÁT TRIỂN TIẾP THEO
- Kiểm tra các giả định của mô hình Hồi quy tuyến tính (Residuals, Homoscedasticity).
- Tối ưu tham số cho mô hình Random Forest bằng GridSearchCV.
- Thử nghiệm mô hình Chuỗi thời gian (Time Series) như ARIMA hoặc LSTM.
- Tích hợp chỉ số THI (Temperature-Humidity Index) vào đặc trưng đầu vào.
KẾT LUẬN
Qua quy trình thực hành Data Science chi tiết trên Python, bài toán dự đoán năng suất sữa bò bằng Data Science không chỉ giúp tối ưu vận hành cho trang trại quy mô 50.000 con mà còn tạo ra giá trị kinh tế trực tiếp cho doanh nghiệp. Đây chính là động lực để các kỹ sư công nghệ tiếp tục theo đuổi các khóa học chuyên sâu về Data Science tại COLE.