Skip to content

Kiểm chứng trước khi tin

Hai câu nói dễ gây tai họa nhất từ thành viên mới là chạy được rồi và điểm cao đấy. Một con số tám mươi phần trăm trên ba mươi mẫu tự dựng nghe thì oai nhưng giấu đi chỗ mô hình mù hẳn một loại tình huống, còn một điểm cao bất thường thường đến từ một đặc trưng vô tình mang thông tin tương lai. Làm sao để biết một con số là thật đáng tin, chứ không phải may rủi hay ảo do rò rỉ?

Bài viết này làm rõ bốn cách kiểm chứng đối nghịch: đo theo loại case thay vì một con phần trăm, thử đủ nhóm ca, soi ba lăng kính audit, và chống rò rỉ dữ liệu.

1. Bảng thuật ngữ cục bộ

Thuật ngữTên tiếng AnhDịch nghĩa & Giải thích
LeakageData LeakageRò rỉ thông tin tương lai vào đầu vào.
AuditIndependent AuditKiểm tra và phản biện độc lập.
RegressionRegression CheckKiểm tính năng cũ không bị hỏng theo.

2. Các khái niệm cốt lõi

2.1 Đo theo loại case, không đo bằng một con phần trăm

  • ⚙️ Cơ chế: Chia dữ liệu thành các loại tình huống có nghĩa, rồi với mỗi loại đánh dấu đã xử lý được, xử lý một phần, hay chưa xử lý.
  • 🔍 Cách nhận diện: Có một bảng phân loại case với trạng thái từng loại, thay cho một con số tổng.
  • 💡 Ý nghĩa: Bảng loại case cho biết mô hình mạnh yếu ở đâu, và tiến độ đo bằng số loại phủ thêm mỗi vòng.
  • ⚠️ Bẫy: Tin một con phần trăm trên tập nhỏ tự dựng, vốn dao động mạnh và che mất chỗ mô hình mù.

2.2 Thử đủ nhóm ca

  • ⚙️ Cơ chế: Một hàm xử lý dữ liệu phải thử qua bốn nhóm ca, không chỉ ca đẹp.
    • Ca thường: Đầu vào hợp lệ cho đầu ra đúng.
    • Ca rỗng: Trường để trống, giá trị thiếu, hay mẫu chưa đủ dữ liệu.
    • Ca ngưỡng: Giá trị nhỏ nhất, lớn nhất, số không, số âm; ví dụ chia cho số lần xuất hiện bằng không.
    • Ca lỗi dữ liệu: Một dòng hỏng được bắt và bỏ qua có kiểm soát, không làm sập cả lần chạy.
  • 🔍 Cách nhận diện: Có test hoặc kịch bản kiểm cho từng nhóm ca trên.
  • 💡 Ý nghĩa: Lỗi hay nấp ở ca rỗng và ca ngưỡng, thử đủ mới yên tâm.
  • ⚠️ Bẫy: Thử một lần với dữ liệu đẹp rồi tuyên bố chạy được rồi.

2.3 Soi ba lăng kính audit

  • ⚙️ Cơ chế: Soi lại một mảng code qua ba lăng kính khác nhau trước khi tin.
    • Lăng kính logic: Đọc thẳng logic nghiệp vụ, kiểm nhánh quyết định đủ hay thiếu hay mâu thuẫn.
    • Lăng kính hành vi: Chạy thử các nhóm ca từ thường tới hiếm mà không quan tâm bên trong.
    • Lăng kính codebase: Soi bảo mật, hiệu năng, chất lượng, ví dụ truy vấn chậm hay khóa truy cập lộ.
  • 🔍 Cách nhận diện: Có ghi nhận vấn đề kèm vị trí file và dòng cho mỗi lăng kính.
  • 💡 Ý nghĩa: Mỗi lăng kính bắt một loại lỗi khác nhau, gộp lại phủ kín hơn một lần đọc.
  • ⚠️ Bẫy: Vừa soi vừa sửa lẫn lộn; lúc audit chỉ ghi nhận, sửa ở một lượt riêng.

2.4 Chống rò rỉ dữ liệu

  • ⚙️ Cơ chế: Rò rỉ là khi mô hình được thấy thông tin mà lúc dự đoán thật sẽ không có; ngăn bằng cách chỉ dùng dữ liệu tới thời điểm dự đoán và học tham số chuẩn hóa chỉ trên tập train.
  • 🔍 Cách nhận diện: Một điểm cao bất thường là dấu hiệu; trace lại từng đặc trưng xem có cái nào biết trước đáp án.
  • 💡 Ý nghĩa: Rò rỉ là nguyên nhân phổ biến nhất của những con số đẹp giả, khử được mới biết tín hiệu có thật.
  • ⚠️ Bẫy: Mừng vì điểm cao mà quên rằng cao bất thường thường là rò rỉ chứ không phải tài năng của mô hình.

✅ Tự kiểm nhanh

  1. Vì sao tám mươi phần trăm trên ba mươi mẫu là một con số yếu để tin?
Đáp án

Vì tập quá nhỏ nên con số dao động mạnh và dễ may rủi, và một con phần trăm tổng che mất chuyện mô hình mù hẳn ở loại tình huống nào. Nên đo theo bảng phân loại case, đánh dấu từng loại đã xử lý được hay chưa.

  1. Một mô hình bỗng đạt điểm cao đáng ngờ. Việc đầu tiên nên làm là gì?
Đáp án

Nghi ngờ rò rỉ dữ liệu và trace lại từng đặc trưng xem có cái nào mang thông tin tương lai hay biết trước đáp án. Điểm cao bất thường thường là dấu hiệu rò rỉ chứ không phải tài năng của mô hình.