Từ bảng lộn xộn ra bảng sạch dùng được
Viết một câu lệnh có đủ chính sách làm sạch (chuẩn hóa tên, chuẩn hóa ngày, bỏ dòng trùng) rồi tự kiểm bảng AI dọn xong còn sót gì.
Kiểm tra lần cuối: 26/9/2026.
Sau bài này bạn sẽ: viết được một câu lệnh nêu rõ chính sách làm sạch và tự đếm lại để biết AI dọn đúng hay còn sót
⏱ khoảng 18 phút (đã tính thời gian chuyển qua lại giữa các app) · 💻 Cần máy tính · Tài khoản công cụ AI: 15+
Vì sao quan trọng

Bài trước cô Hạnh dán một bảng gọn gàng. Nhưng sổ tay thật của cô không gọn như vậy: có hôm cô ghi "Hà Nội", có hôm ghi tắt "HN", có hôm con cô phụ ghi sổ lại gõ "ha noi" không dấu. Ngày tháng cũng vậy — lúc thì 05/06/2026, lúc thì 2026-06-05, lúc thì 5/6/26. Tệ hơn: một đơn hàng bận quá ghi sổ hai lần, mỗi lần một kiểu ngày, nhìn qua tưởng là hai đơn khác nhau.
Đây không phải lỗi hiếm. Bảng dữ liệu thật của ai cũng vậy — nhiều người ghi, nhiều đợt, nhiều thói quen. Cộng thẳng một bảng như vậy thì số vùng "yếu" có khi chỉ là vùng bị viết tên tách ra làm ba, và tổng tiền bị đôn lên vì một đơn tính hai lần.
Bảng lộn xộn và bảng đã dọn
Bảng lộn xộn
- Vùng: “HN”, “ha noi”, “Hà nội” — cùng một chỗ mà thành nhiều dòng khác nhau
- Ngày: bốn kiểu viết cho cùng một khoảng thời gian
- Một đơn bị ghi hai lần vì ngày viết khác kiểu, tưởng là hai đơn
Bảng đã dọn
- Vùng chỉ còn đúng một tên cho mỗi nơi
- Ngày về đúng một kiểu, so sánh được
- Đơn trùng bị gộp lại, chỉ tính đúng một lần
Vì sao "trùng" lại khó thấy đến vậy?
Máy tính chỉ so chữ với chữ, không so nghĩa với nghĩa. Chuỗi chữ "07/06/2026" và chuỗi chữ "2026-06-07" với con người là cùng một ngày; với một phép so sánh chữ đơn giản thì đây là hai chuỗi khác hẳn nhau, không có gì báo trùng. Muốn thấy trùng, phải đổi cả hai về cùng một dạng trước, rồi mới so. Đây là lý do chính sách làm sạch phải nói rõ thứ tự: chuẩn hóa trước, tìm trùng sau — làm ngược lại thì bỏ sót.
Thử ngay — dọn một bảng lộn xộn
▶ Thử ngay
Bấm Chép câu lệnh dưới đây (dữ liệu bịa ra để tập luyện, không phải khách thật) rồi dán vào Gemini hoặc ChatGPT.
Câu lệnh để dán vào AI
Đây là sổ đơn hàng tuần sau của cùng tiệm mỹ phẩm, dữ liệu bịa ra để tập luyện. Người ghi sổ viết cột Vùng và Ngày không thống nhất mỗi dòng một kiểu. Hãy: (1) chuẩn hóa cột Vùng chỉ còn đúng một trong ba tên "Hà Nội", "Đà Nẵng", "Cần Thơ"; (2) chuẩn hóa cột Ngày về đúng một dạng dd/mm/yyyy; (3) tìm và loại bỏ dòng bị trùng (cùng ngày, cùng khách, cùng sản phẩm, cùng số lượng); (4) trả về bảng đã sạch, giữ nguyên các cột, và nói rõ đã bỏ bao nhiêu dòng trùng. Ngày,Khách,Vùng,Sản phẩm,Số lượng,Đơn giá (nghìn đồng) 03/06/2026,Chị Hoa,Hà Nội,Son,2,150 2026-06-04,Anh Tùng,HN,Kem dưỡng,1,320 5/6/26,Chị Mai,Đà Nẵng,Mặt nạ,4,45 06-06-2026,Chị Lan,da nang,Sữa rửa mặt,3,90 07/06/2026,Chị Hương,Cần Thơ,Kem dưỡng,2,320 2026-06-07,Chị Hương,Cần Thơ,Kem dưỡng,2,320 08/06/2026,Anh Phúc,ha noi,Son,1,150 9/6/26,Chị Yến,Đà Nẵng,Mặt nạ,6,45 10-06-2026,Anh Đức,DN,Son,3,150 11/06/2026,Chị Hoa,Hà nội,Sữa rửa mặt,1,90 2026-06-12,Chị Mai,can tho,Kem dưỡng,1,320 13/06/2026,Chị Bích,Cần Thơ,Son,2,150
Đọc bảng AI trả về. Đếm số dòng: bảng gốc có 12 dòng — bảng sạch còn bao nhiêu?
- Dán câu lệnh có sẵn chính sách làm sạch (3 tên vùng, dạng ngày, định nghĩa trùng) vào khung chat.
- Gửi đi, chờ ChatGPT dọn bảng.
- Đọc bảng sạch: đếm còn 11 dòng, đối chiếu với 12 dòng gốc.
- Đọc câu ChatGPT báo đã bỏ bao nhiêu dòng trùng.
Xem một kết quả mẫu
Kết quả của bạn khác là bình thường. Hãy so 3 điểm dưới đây, không so từng chữ.
Chạy thật ngày 26/9/2026 trên ChatGPT và Gemini bản miễn phí, trình duyệt điện thoại, không đăng nhập.
ChatGPT trả lời:
Đã chuẩn hóa các biến thể vùng (HN, ha noi, Hà nội → Hà Nội; da nang, DN → Đà Nẵng; can tho → Cần Thơ) và đưa toàn bộ ngày về dạng dd/mm/yyyy.
Dòng trùng là ngày 07/06/2026, khách Chị Hương, vùng Cần Thơ, sản phẩm Kem dưỡng, số lượng 2. Có 1 dòng trùng được loại bỏ.
[bảng 11 dòng]
Đã bỏ: 1 dòng trùng.
Gemini trả lời gần giống hệt, còn nói rõ số dòng gốc bị trùng: "Số dòng trùng đã loại bỏ: 1 dòng (Dòng thứ 5 trong bản gốc của Chị Hương vào ngày 07/06/2026 bị trùng hoàn toàn về ngày, khách, sản phẩm và số lượng với dòng thứ 4)." Để ý: Gemini đánh số dòng lệch một (có vẻ đếm từ 0) — đếm đúng theo bảng gốc (dòng đầu là dòng 1) thì hai dòng của Chị Hương trùng nhau là dòng 5 và dòng 6, không phải dòng 4. Vị trí dòng AI nêu cũng phải tự kiểm, không chỉ tin số nó nói.
Tự đếm lại bằng Python trên đúng 12 dòng gốc: sau khi chuẩn hóa và loại trùng, còn đúng 11 dòng — khớp cả hai câu trả lời. Lần này cả hai công cụ đều dọn đúng; không phải lúc nào cũng vậy, nên bước tự đếm lại số dòng vẫn là bước không được bỏ qua.

So 3 điểm:
- Mọi cách viết khác của mỗi vùng (HN, ha noi, Hà nội, da nang, DN, can tho) đều gộp về đúng một tên (Hà Nội / Đà Nẵng / Cần Thơ).
- Mọi ngày về cùng một dạng dd/mm/yyyy, không còn kiểu 2026-06-04 hay 5/6/26.
- Đúng 1 dòng trùng bị phát hiện và loại bỏ — dòng của Chị Hương ngày 07/06/2026, bị ghi hai lần dưới hai định dạng ngày khác nhau.
Vì sao phải ghi rõ chính sách ngay trong câu lệnh
Câu lệnh ở trên không chỉ nói "dọn cho sạch" — nó nói rõ chuẩn hóa Vùng còn đúng 3 tên nào, ngày về đúng dạng nào, và trùng nghĩa là gì (cùng ngày, cùng khách, cùng sản phẩm, cùng số lượng). Đây gọi là chính sách làm sạch: một danh sách bước xử lý được ghi rõ, để AI làm giống nhau mỗi lần, và để số bạn ra so được với số của người khác làm cùng bảng đó.
Không ghi rõ thì mỗi lần chạy có thể mỗi kiểu: lần này gộp "HN" vào Hà Nội, lần khác lại để riêng vì "không chắc HN là viết tắt của gì". Số lệch nhau không phải vì AI "tính sai" — mà vì chính sách khác nhau. Kiểm chính sách trước, rồi mới kết luận AI đúng hay sai.
Kết quả khác dự kiến?
Bảng dọn xong chưa đúng — sửa đúng chỗ
- AI gộp nhầm hai vùng khác nhau làm một (ví dụ gộp Cần Thơ vào Đà Nẵng) → liệt kê lại đúng ba tên được phép, nhắc lại trong câu lệnh.
- AI không phát hiện dòng trùng vì ngày viết khác định dạng → nhắc rõ: “hai dòng cùng Khách, cùng Sản phẩm, cùng Số lượng nhưng Ngày viết khác kiểu vẫn tính là trùng”.
- AI tự ý sửa luôn cả Đơn giá hoặc Số lượng khi “dọn” → nhắc: “chỉ chuẩn hóa Vùng và Ngày, không đổi số liệu khác”.
- Bảng dài hơn 20-30 dòng, AI dọn sót vài dòng cuối → chia nhỏ bảng, dọn từng phần, tự cộng số dòng ở cuối.
Câu kiểm tra
Làm trên việc thật của bạn
Chọn một danh sách của bạn có khả năng bị viết khác kiểu nhau: tên khách hàng, tên sản phẩm, tên nhân viên giao hàng. Nếu cột cần dọn là tên người (khách, nhân viên), thay bằng mã [Khách A], [NV1] trước khi dán — AI không cần tên thật để chuẩn hóa cách viết. Ưu tiên tập với cột tên sản phẩm hoặc tên vùng nếu có thể. Chép khung dưới, điền chính sách làm sạch của riêng bạn:
Câu lệnh để dán vào AI
Đây là [tên bảng] của tôi, dữ liệu thật/dữ liệu bịa để tập luyện. Cột [tên cột] đang viết không thống nhất. Hãy: (1) chuẩn hóa cột [tên cột] chỉ còn đúng các tên sau: [liệt kê từng tên đúng]; (2) chuẩn hóa cột Ngày (nếu có) về dạng dd/mm/yyyy; (3) tìm và loại dòng trùng theo [nêu rõ trùng nghĩa là cùng những cột nào]; (4) trả bảng đã sạch và nói rõ đã bỏ bao nhiêu dòng. [dán bảng dạng CSV — dòng đầu là tên cột]
Tự chấm
Tóm lại
- Bảng lộn xộn: cùng một nơi viết nhiều kiểu, ngày viết nhiều dạng, đơn trùng núp dưới cách viết khác nhau.
- Ghi rõ chính sách làm sạch ngay trong câu lệnh — đừng chỉ nói "dọn cho sạch".
- Đếm lại số dòng trước/sau để biết AI dọn đúng, dọn sót, hay dọn nhầm.
Tên và giao diện sản phẩm thuộc về chủ sở hữu tương ứng. BaoPeak không liên kết, không được tài trợ bởi các công ty này.
Dán một bảng nhỏ, hỏi một câu, tự kiểm một con số
Dán một bảng nhỏ dạng chữ vào AI, đặt đúng một câu hỏi, rồi tự cộng lại để biết AI vừa tính đúng hay đoán bừa.
Nhờ AI viết công thức — tự kiểm trước khi dùng
Xin AI viết công thức SUMIFS/COUNTIFS cho Google Sheets hoặc Excel, và tự kiểm công thức đó bằng cách chạy thử trên đúng bảng của mình.