Ngân hàng đề — Microsoft Azure AI Fundamentals

Tìm thấy 316 câu.

Câu 1
A healthcare company is developing an application to analyze X-ray images and identify potential abnormalities. The development team needs to choose an AI approach that can automatically learn features from the images without manual feature engineering. Which characteristic of deep learning makes it most suitable for this scenario?
  1. A Deep learning models always provide transparent, easily interpretable explanations for their classification decisions.
  2. B Deep learning uses multiple layers of neural networks to automatically extract hierarchical features from raw image data.
  3. C Deep learning uses pre-defined rules and logic trees to classify images based on expert-programmed criteria.
  4. D Deep learning requires minimal training data and computational resources compared to traditional machine learning approaches.
Xem giải thích

Đáp án

B — Học sâu dùng nhiều lớp mạng nơ-ron để TỰ ĐỘNG trích xuất đặc trưng phân cấp từ dữ liệu ảnh thô.

Vì sao đúng

⚠ Đề nhấn "tự học đặc trưng, KHÔNG cần kỹ thuật đặc trưng thủ công":

⚠ Học máy TRUYỀN THỐNG
   ⚠ con người phải TỰ NGHĨ RA đặc trưng
   ⚠ "độ tương phản", "số cạnh", "diện tích vùng sáng"
        ↓ ⚠ tốn công, cần chuyên gia

⚠ HỌC SÂU
   ⚠ Lớp 1: học cạnh, đường viền
   ⚠ Lớp 2: học hình dạng cơ bản
   ⚠ Lớp 3: học cấu trúc phức tạp
   ⚠ Lớp cuối: nhận ra bất thường
        ↓
⚠ TỰ HỌC từ ảnh thô

⚠ "Phân cấp" (hierarchical) nghĩa là ⚠ lớp sau xây trên đặc trưng của lớp trước — ⚠ từ đơn giản tới phức tạp.

Vì sao các phương án khác sai

  • A (học sâu luôn cho giải thích minh bạch, dễ hiểu) — ⚠ NGƯỢC HOÀN TOÀN: ⚠ mạng nơ-ron sâu nổi tiếng là ⚠ "hộp đen" — ⚠ rất khó giải thích vì sao nó quyết định như vậy.

  • C (dùng luật và cây logic định sẵn) — ⚠ đó là hệ CHUYÊN GIA (expert system): ⚠ mô hình AI của thập niên 1980, ⚠ hoàn toàn khác học sâu.

  • D (cần rất ít dữ liệu và tài nguyên tính toán) — ⚠ NGƯỢC LẠI: ⚠ học sâu ⚠ đòi rất nhiều dữ liệu và GPU.

Ghi nhớ

⚠ Học sâu — đặc điểm phải thuộc: | Đặc điểm | Nội dung | |---|---| | ⚠ Tự trích đặc trưng | ⚠ ưu điểm LỚN NHẤT | | ⚠ Nhiều lớp nơ-ron | ⚠ "sâu" nghĩa là nhiều lớp | | ⚠ Đặc trưng phân cấp | ⚠ đơn giản → phức tạp | | ⚠ Cần NHIỀU dữ liệu | ⚠ hàng nghìn tới hàng triệu mẫu | | ⚠ Cần GPU/TPU | | | ⚠ Khó giải thích | ⚠ hộp đen |

Từ khoá nhận diện:

"tự học đặc trưng từ dữ liệu thô" → ⚠ học sâu "luật do chuyên gia lập trình" → ⚠ hệ chuyên gia, KHÔNG phải học máy "cần ít dữ liệu" → ⚠ học máy truyền thống, hoặc transfer learning "giải thích được quyết định" → ⚠ cây quyết định, hồi quy tuyến tính

⚠ Vấn đề "hộp đen" trong y tế Vấn đề
⚠ Bác sĩ cần BIẾT VÌ SAO mô hình cảnh báo
⚠ Quy định y tế thường đòi giải thích được
⚠ Kỹ thuật hỗ trợ: Grad-CAM, saliency map ⚠ tô sáng vùng ảnh mô hình chú ý
⚠ Vì vậy ⚠ hệ thống y tế thường chỉ GỢI Ý, người quyết định cuối
⚠ Transfer learning — giảm nhu cầu dữ liệu Kỹ thuật
⚠ Dùng mô hình đã huấn luyện trên tập ảnh khổng lồ
⚠ Huấn luyện tiếp trên dữ liệu ít của mình
⚠ Giảm nhu cầu dữ liệu từ hàng triệu xuống hàng nghìn
⚠ Trong y tế ⚠ rất phổ biến vì dữ liệu ảnh y tế có nhãn rất hiếm
⚠ Học máy truyền thống so với học sâu So sánh
⚠ Truyền thống: người chọn đặc trưng, mô hình đơn giản ⚠ ít dữ liệu, giải thích được
⚠ Học sâu: máy tự chọn đặc trưng, mô hình phức tạp ⚠ nhiều dữ liệu, khó giải thích
⚠ Với dữ liệu BẢNG ⚠ học máy truyền thống thường THẮNG
⚠ Với ảnh, âm thanh, văn bản ⚠ học sâu vượt trội

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có đủ dữ liệu có nhãn không | ⚠ học sâu đòi rất nhiều | | Có cần giải thích được quyết định không | | | Đã cân nhắc transfer learning chưa | |

Và điều làm học sâu thay đổi hẳn lĩnh vực xử lý ảnh: nó xoá bỏ nhu cầu có một chuyên gia ngồi nghĩ ra đặc trưng. Trước đó, chất lượng mô hình phụ thuộc vào việc ai đó đủ giỏi để biết cần đo cái gì trong bức ảnh.

Câu 2
Your company is developing a customer service chatbot and needs to select an appropriate language model from Azure AI Foundry. The development team wants to compare different models' capabilities, view licensing terms, and test models with sample prompts before making a final decision. Which feature of Azure AI Foundry should they primarily use?
  1. A Azure AI Foundry model catalog
  2. B Azure OpenAI Service playground
  3. C Azure Cognitive Services REST APIs
  4. D Azure Machine Learning designer
Xem giải thích

Đáp án

A — Azure AI Foundry model catalog.

Vì sao đúng

⚠ Đề nêu ba nhu cầu, model catalog đáp ứng cả ba: | Nhu cầu | Model catalog | |---|---| | ⚠ SO SÁNH năng lực các mô hình | ⚠ bảng thông tin, chỉ số benchmark | | ⚠ Xem ĐIỀU KHOẢN GIẤY PHÉP | ⚠ hiển thị license của từng mô hình | | ⚠ THỬ với prompt mẫu | ⚠ playground tích hợp ngay trong catalog |

⚠ Model catalog
   ⚠ hàng nghìn mô hình
   ⚠ OpenAI, Meta Llama, Mistral,
     Cohere, Hugging Face, Microsoft Phi
        ↓
⚠ Lọc theo: tác vụ, nhà cung cấp,
   giấy phép, cách triển khai
        ↓
⚠ So sánh, thử, rồi triển khai

Vì sao các phương án khác sai

  • B (Azure OpenAI Service playground) — ⚠ chỉ THỬ được mô hình OpenAI: ⚠ không so sánh được với Llama, Mistral hay các mô hình khác; ⚠ không có thông tin giấy phép của nhiều nhà cung cấp.

  • D (Azure Machine Learning designer) — ⚠ công cụ KÉO THẢ để dựng pipeline ML truyền thống: ⚠ không phải nơi duyệt catalog mô hình ngôn ngữ.

  • C (Azure Cognitive Services REST API) — ⚠ gọi các dịch vụ AI dựng sẵn: ⚠ không phải nơi so sánh mô hình.

Ghi nhớ

⚠ Azure AI Foundry — các thành phần chính: | Thành phần | Việc | |---|---| | ⚠ Model catalog | ⚠ duyệt, so sánh, thử mô hình — đề này | | ⚠ Playground | ⚠ thử prompt tương tác | | ⚠ Prompt flow | ⚠ dựng luồng xử lý prompt phức tạp | | ⚠ Evaluation | ⚠ đánh giá chất lượng mô hình có hệ thống | | ⚠ Content filters | ⚠ cấu hình lọc nội dung | | ⚠ Deployments | ⚠ triển khai mô hình thành endpoint |

Từ khoá nhận diện:

"so sánh nhiều mô hình, xem giấy phép" → ⚠ model catalog "thử prompt nhanh" → ⚠ playground "dựng pipeline ML kéo thả" → ⚠ Azure ML designer "đánh giá chất lượng có hệ thống" → ⚠ evaluation trong Foundry

⚠ Tiêu chí chọn mô hình ngôn ngữ Tiêu chí
⚠ Năng lực ⚠ chất lượng đầu ra cho tác vụ của bạn
⚠ Chi phí ⚠ giá theo token, mô hình lớn đắt hơn nhiều
⚠ Độ trễ ⚠ mô hình nhỏ nhanh hơn
⚠ Giấy phép ⚠ có được dùng thương mại không
⚠ Cách triển khai ⚠ serverless API hay managed compute
⚠ Cửa sổ ngữ cảnh ⚠ xử lý được bao nhiêu token
⚠ Sai lầm phổ biến khi chọn mô hình Sai lầm
⚠ Chọn mô hình LỚN NHẤT mặc định ⚠ đắt và chậm không cần thiết
⚠ Không thử với dữ liệu THẬT của mình
⚠ Bỏ qua điều khoản giấy phép
⚠ Không đo chi phí ở quy mô thật
⚠ Cách đúng ⚠ bắt đầu từ mô hình NHỎ, chỉ nâng khi thật sự cần
⚠ Hai cách triển khai mô hình trong Foundry Cách
⚠ Serverless API ⚠ trả theo token, không quản hạ tầng
⚠ Managed compute ⚠ cấp máy riêng, trả theo giờ
⚠ Chọn serverless khi ⚠ tải thất thường, không muốn quản gì
⚠ Chọn managed khi ⚠ tải cao ổn định, cần độ trễ thấp và ổn định

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đã thử mô hình nhỏ trước chưa | | | Giấy phép có cho dùng thương mại không | | | Đã ước tính chi phí ở quy mô thật chưa | |

Và sai lầm tốn kém nhất khi bắt đầu một dự án AI sinh ngữ: mặc định chọn mô hình mạnh nhất. Rất nhiều tác vụ được giải quyết tốt bởi một mô hình nhỏ hơn mười lần, nhanh hơn và rẻ hơn hàng chục lần.

Câu 3
A healthcare organization is deploying an AI system to assist radiologists in identifying potential abnormalities in X-ray images. The system will flag images for priority review but will not make final diagnostic decisions. What should be the PRIMARY safety consideration when implementing this solution?
  1. A Ensure the AI model is trained on diverse patient demographics and regularly monitored for performance degradation across different patient populations.
  2. B Design the system to replace radiologist review for common cases to reduce healthcare costs.
  3. C Implement the system with the fastest processing speed to reduce patient wait times for diagnoses.
  4. D Configure the system to automatically reject any X-ray images that don't meet minimum quality standards.
Xem giải thích

Đáp án

A — Bảo đảm mô hình được huấn luyện trên dữ liệu nhân khẩu học ĐA DẠNG và theo dõi thường xuyên xem hiệu năng có suy giảm ở các nhóm bệnh nhân khác nhau không.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này và #17918 dùng CÙNG kịch bản nhưng hỏi hai nguyên tắc khác nhau.

Câu Hỏi nguyên tắc
⚠ #17917 (câu này) ⚠ AN TOÀN và ĐỘ TIN CẬY
⚠ #17918 ⚠ TRÁCH NHIỆM GIẢI TRÌNH (accountability)
⚠ Không mâu thuẫn ⚠ hai khía cạnh khác nhau của cùng một hệ thống

Vì sao đúng

⚠ Hai vế của phương án A đều thuộc về an toàn: | Vế | Vì sao quan trọng | |---|---| | ⚠ Dữ liệu huấn luyện ĐA DẠNG | ⚠ mô hình học từ một nhóm sẽ hoạt động kém với nhóm khác | | ⚠ Theo dõi hiệu năng theo NHÓM | ⚠ phát hiện suy giảm trước khi gây hại |

⚠ Huấn luyện chỉ trên bệnh nhân
   một chủng tộc, một độ tuổi
        ↓
⚠ Triển khai cho toàn bộ dân số
        ↓
⚠ Bỏ sót bất thường ở nhóm chưa học
        ↓
⚠ Hậu quả Y TẾ nghiêm trọng

⚠ Trong y tế, sai sót không phân bố đều là một dạng gây hại thật sự.

Vì sao các phương án khác sai

  • B (thay thế bác sĩ với ca thông thường để giảm chi phí) — ⚠ NGƯỢC với chính đề bài: ⚠ đề nói rõ hệ thống ⚠ không đưa quyết định chẩn đoán cuối cùng.

  • C (tối ưu tốc độ xử lý để giảm thời gian chờ) — ⚠ tốc độ không phải mối quan tâm AN TOÀN chính: ⚠ nhanh mà sai thì tệ hơn.

  • D (tự động từ chối ảnh không đạt chuẩn chất lượng) — ⚠ hữu ích nhưng là chi tiết kỹ thuật: ⚠ không phải cân nhắc an toàn CHÍNH.

Ghi nhớ

⚠ Sáu nguyên tắc Responsible AI của Microsoft — bảng phải thuộc: | Nguyên tắc | Câu hỏi cốt lõi | |---|---| | ⚠ Fairness (công bằng) | ⚠ hệ thống có đối xử công bằng với mọi nhóm không | | ⚠ Reliability & Safety | ⚠ hoạt động ĐÁNG TIN CẬY và AN TOÀN không — câu này | | ⚠ Privacy & Security | ⚠ bảo vệ dữ liệu thế nào | | ⚠ Inclusiveness (bao trùm) | ⚠ mọi người dùng được không | | ⚠ Transparency (minh bạch) | ⚠ người dùng hiểu hệ thống làm gì không | | ⚠ Accountability (trách nhiệm) | ⚠ ai chịu trách nhiệm — #17918 |

Từ khoá nhận diện:

"hoạt động đúng, không gây hại" → ⚠ Reliability & Safety "đối xử công bằng giữa các nhóm" → ⚠ Fairness "ai chịu trách nhiệm, ghi log để rà soát" → ⚠ Accountability "người dùng hiểu vì sao" → ⚠ Transparency

⚠ Fairness và Safety chồng lấn thế nào Chồng lấn
⚠ Dữ liệu huấn luyện lệch → mô hình kém với nhóm thiểu số
⚠ Đó vừa là vấn đề CÔNG BẰNG vừa là vấn đề AN TOÀN
⚠ Trong y tế, hai thứ này gần như không tách được
⚠ Cách xử lý ⚠ đo hiệu năng RIÊNG cho từng nhóm, không chỉ nhìn con số tổng
⚠ Vì sao chỉ nhìn độ chính xác tổng là nguy hiểm Lý do
⚠ Độ chính xác 95% tổng thể
⚠ Nhưng 98% ở nhóm đa số, 70% ở nhóm thiểu số
⚠ Con số tổng che giấu hoàn toàn vấn đề
⚠ Bắt buộc ⚠ phân tách chỉ số theo từng nhóm nhân khẩu
⚠ Trôi mô hình (model drift) trong y tế Trôi
⚠ Thiết bị chụp X-quang thay đổi
⚠ Quy trình chụp thay đổi
⚠ Dân số bệnh nhân thay đổi
⚠ Hậu quả ⚠ mô hình xuống cấp âm thầm
⚠ Cần ⚠ giám sát liên tục và huấn luyện lại định kỳ

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Chỉ số có được phân tách theo nhóm không | | | Dữ liệu huấn luyện có đại diện cho dân số thật không | | | Có quy trình giám sát trôi mô hình không | |

Và cách một hệ thống AI y tế gây hại mà không ai phát hiện ra ngay: nó hoạt động rất tốt trên trung bình và rất tệ với một nhóm nhỏ. Chỉ số tổng thể vẫn đẹp, và những người bị ảnh hưởng thì quá ít để tạo thành tín hiệu.

Câu 4
A healthcare organization is deploying an AI system to assist radiologists in detecting abnormalities in X-ray images. The system provides confidence scores and highlights areas of concern, but radiologists make the final diagnosis. What is the MOST important accountability consideration the organization should implement?
  1. A Ensure the AI system achieves 100% accuracy before deployment to eliminate any possibility of misdiagnosis.
  2. B Keep the AI system's decision-making process completely autonomous to avoid confusing accountability between humans and AI.
  3. C Maintain detailed logs of all AI recommendations, radiologist decisions, and patient outcomes to enable review and improvement.
  4. D Replace human radiologists with the AI system to establish clear accountability with the technology vendor.
Xem giải thích

Đáp án

C — Lưu nhật ký chi tiết mọi khuyến nghị của AI, quyết định của bác sĩ và kết quả điều trị, để có thể rà soát và cải thiện.

Ghi nhớ về chất lượng câu hỏi

⚠ Câu này dùng CÙNG kịch bản với #17917 nhưng hỏi nguyên tắc KHÁC.

Câu Nguyên tắc Khoá
⚠ #17917 ⚠ An toàn và độ tin cậy ⚠ dữ liệu đa dạng + giám sát theo nhóm
⚠ #17918 (câu này) ⚠ TRÁCH NHIỆM GIẢI TRÌNH ⚠ ghi nhật ký đầy đủ để rà soát
⚠ Bổ sung nhau ⚠ một hệ thống tốt cần cả hai

Vì sao đúng

⚠ Accountability đòi hỏi có thể TRUY VẾT và GIẢI TRÌNH: | Ghi lại gì | Vì sao | |---|---| | ⚠ Khuyến nghị của AI | ⚠ mô hình đã nói gì | | ⚠ Quyết định của bác sĩ | ⚠ con người đã làm gì với khuyến nghị đó | | ⚠ Kết quả điều trị | ⚠ thực tế diễn ra thế nào |

⚠ Ba dữ liệu này ghép lại
        ↓
⚠ Trả lời được:
   ⚠ "AI có bỏ sót ca nào không?"
   ⚠ "Bác sĩ có tin AI quá mức không?"
   ⚠ "Mô hình có đang xuống cấp không?"
        ↓
⚠ Cơ sở để CẢI THIỆN và GIẢI TRÌNH

Vì sao các phương án khác sai

  • A (đạt 100% chính xác trước khi triển khai) — ⚠ BẤT KHẢ THI: ⚠ không mô hình nào đạt 100%; ⚠ đòi hỏi này chỉ khiến hệ thống không bao giờ được dùng.

  • B (giữ AI hoàn toàn tự chủ để tránh nhập nhằng trách nhiệm) — ⚠ NGƯỢC hoàn toàn: ⚠ tự chủ hoàn toàn làm trách nhiệm ⚠ mờ đi, không rõ hơn.

  • D (thay bác sĩ bằng AI để nhà cung cấp công nghệ chịu trách nhiệm) — ⚠ vô lý về mặt y tế và pháp lý: ⚠ và ⚠ trái với chính mô tả trong đề.

Ghi nhớ

⚠ Accountability — bốn thành phần phải thuộc: | Thành phần | Nội dung | |---|---| | ⚠ Con người CHỊU TRÁCH NHIỆM cuối cùng | ⚠ AI hỗ trợ, không thay thế | | ⚠ Nhật ký đầy đủ, truy vết được | ⚠ đề này | | ⚠ Quy trình rà soát định kỳ | | | ⚠ Cơ chế khiếu nại và sửa sai | |

Từ khoá nhận diện:

"ghi log, truy vết, rà soát" → ⚠ Accountability "dữ liệu đa dạng, giám sát hiệu năng" → ⚠ Reliability & Safety "người dùng hiểu vì sao AI quyết định vậy" → ⚠ Transparency "đối xử công bằng giữa các nhóm" → ⚠ Fairness

⚠ Vì sao ghi log là nền của accountability Lý do
⚠ Không có log thì không giải trình được
⚠ Không có log thì không cải thiện được ⚠ không biết sai ở đâu
⚠ Không có log thì không phát hiện được trôi mô hình
⚠ Kiểm toán y tế luôn đòi bằng chứng
⚠ "Human in the loop" — mô hình đúng cho y tế Mô hình
⚠ AI GỢI Ý, người QUYẾT ĐỊNH
⚠ AI làm nổi bật vùng đáng chú ý
⚠ Bác sĩ có thể bỏ qua khuyến nghị
⚠ Ghi lại cả khi bác sĩ KHÔNG đồng ý ⚠ dữ liệu quý để cải thiện mô hình
⚠ Rủi ro cần theo dõi ⚠ automation bias — con người tin máy quá mức
⚠ Automation bias — rủi ro ít được nói tới Rủi ro
⚠ Người dùng dần tin AI mà không kiểm tra kỹ
⚠ AI sai và con người cũng không phát hiện
⚠ "Human in the loop" trên giấy nhưng không thật
⚠ Phát hiện bằng cách ⚠ theo dõi tỉ lệ bác sĩ KHÔNG đồng ý với AI — quá thấp là dấu hiệu xấu

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có ghi lại cả trường hợp người KHÔNG đồng ý với AI không | | | Có ai định kỳ đọc log và rút bài học không | | | Tỉ lệ con người ghi đè khuyến nghị AI là bao nhiêu | ⚠ quá thấp là cảnh báo |

Và chỉ số cảnh báo sớm cho automation bias trong mọi hệ thống có con người giám sát AI: tỉ lệ người dùng phủ quyết máy tiến dần về không. Khi đó "con người trong vòng lặp" chỉ còn là một dòng trong tài liệu.

Câu 5
A healthcare company wants to develop an application that allows doctors to dictate patient notes verbally, which are then automatically converted to text and stored in the patient management system. The application must support real-time transcription as the doctor speaks. Which Azure AI Speech service feature should the company implement?
  1. A Speech-to-text
  2. B Speech translation
  3. C Speech synthesis
  4. D Text-to-speech
Xem giải thích

Đáp án

A — Speech-to-text (chuyển giọng nói thành văn bản).

Vì sao đúng

⚠ Đề nêu rõ: bác sĩ ĐỌC, hệ thống chuyển thành CHỮ, theo thời gian thực.

⚠ Bác sĩ nói
        ↓ ⚠ Speech-to-text
⚠ Văn bản
        ↓
⚠ Lưu vào hệ thống bệnh án
Chế độ Nội dung
⚠ Real-time transcription ⚠ phiên âm ngay khi nói — đề này
⚠ Batch transcription ⚠ xử lý file âm thanh đã ghi sẵn
⚠ Fast transcription ⚠ file ngắn, trả kết quả nhanh

Vì sao các phương án khác sai

  • C (speech synthesis) và D (text-to-speech) — ⚠ hai tên gọi của CÙNG một thứ: ⚠ chuyển CHỮ thành GIỌNG NÓI — ⚠ ngược chiều với đề.

  • B (speech translation) — ⚠ vừa phiên âm vừa DỊCH sang ngôn ngữ khác: ⚠ đề không yêu cầu dịch.

Ghi nhớ

⚠ Azure AI Speech — bốn năng lực chính: | Năng lực | Chiều | |---|---| | ⚠ Speech-to-text | ⚠ giọng nói → chữ | | ⚠ Text-to-speech | ⚠ chữ → giọng nói | | ⚠ Speech translation | ⚠ giọng nói → chữ hoặc giọng nói ngôn ngữ khác | | ⚠ Speaker recognition | ⚠ nhận ra AI đang nói |

Từ khoá nhận diện:

"đọc chính tả, ghi biên bản" → ⚠ speech-to-text "đọc văn bản ra loa" → ⚠ text-to-speech "phiên dịch trực tiếp" → ⚠ speech translation "xác thực bằng giọng nói" → ⚠ speaker recognition

⚠ Custom Speech — cần cho lĩnh vực chuyên môn Vì sao
⚠ Thuật ngữ y khoa mô hình chung không biết
⚠ Tên thuốc, tên bệnh, tên thủ thuật
⚠ Huấn luyện thêm bằng dữ liệu âm thanh và văn bản của mình
⚠ Với ứng dụng y tế ⚠ gần như BẮT BUỘC dùng Custom Speech
⚠ Nếu không ⚠ tỉ lệ lỗi từ với thuật ngữ chuyên môn rất cao
⚠ Tính năng hữu ích cho ghi bệnh án Tính năng
⚠ Phrase list ⚠ gợi ý danh sách từ có thể xuất hiện
⚠ Custom Speech model ⚠ huấn luyện riêng cho ngành
⚠ Profanity filter
⚠ Diarization ⚠ phân biệt AI đang nói khi có nhiều người
⚠ Punctuation tự động
⚠ Lưu ý về quyền riêng tư Lưu ý
⚠ Dữ liệu giọng nói bệnh nhân là dữ liệu y tế nhạy cảm
⚠ Cần ký BAA nếu chịu HIPAA
⚠ Cân nhắc chạy container tại chỗ ⚠ dữ liệu không rời khỏi bệnh viện
⚠ Tắt logging phía dịch vụ nếu cần

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Tỉ lệ lỗi từ với thuật ngữ chuyên môn là bao nhiêu | ⚠ đo trên bản ghi thật | | Có cần Custom Speech không | | | Dữ liệu giọng nói được xử lý ở đâu | |

Và điều quyết định một hệ thống đọc chính tả y khoa có được bác sĩ dùng hay không: nó có nhận đúng tên thuốc không. Mô hình chung phiên âm hội thoại đời thường rất tốt, và sai gần như mọi thuật ngữ chuyên ngành.

Câu 6
A healthcare organization receives thousands of patient intake forms daily in various formats including handwritten paper forms, typed PDFs, and scanned documents. The organization needs to automatically extract patient names, dates of birth, medical identification numbers, and insurance information from these forms to populate their electronic health record system. Which Azure AI service should they use?
  1. A Azure AI Document Intelligence
  2. B Azure AI Computer Vision
  3. C Azure AI Language
  4. D Azure AI Speech
Xem giải thích

Đáp án

A — Azure AI Document Intelligence.

Vì sao đúng

⚠ Đề nêu ba đặc điểm, cả ba đều là thế mạnh của Document Intelligence: | Đặc điểm | Document Intelligence | |---|---| | ⚠ Nhiều định dạng: viết tay, PDF, ảnh quét | ⚠ xử lý được tất cả | | ⚠ Trích xuất TRƯỜNG cụ thể | ⚠ tên, ngày sinh, mã bảo hiểm | | ⚠ Đưa vào hệ thống khác | ⚠ trả về JSON có cấu trúc |

⚠ Biểu mẫu (giấy, PDF, ảnh)
        ↓ ⚠ Document Intelligence
⚠ Nhận ra CẤU TRÚC biểu mẫu
⚠ Trích xuất từng TRƯỜNG
   ⚠ "Họ tên: Nguyễn Văn A"
   ⚠ "Ngày sinh: 01/01/1980"
        ↓
⚠ JSON có cấu trúc, kèm điểm tin cậy

⚠ Khác biệt then chốt so với OCR thuần: ⚠ OCR trả về chữ, ⚠ Document Intelligence trả về cặp trường-giá trị.

Vì sao các phương án khác sai

  • B (Azure AI Computer Vision) — ⚠ OCR/Read chỉ trả về CHỮ và vị trí: ⚠ ⚠ không hiểu "đây là ô Họ tên, kia là ô Ngày sinh"; ⚠ bạn phải tự viết logic ghép trường.

  • C (Azure AI Language) — ⚠ xử lý VĂN BẢN đã có: ⚠ không đọc được ảnh hay PDF quét.

  • D (Azure AI Speech) — ⚠ xử lý ÂM THANH, hoàn toàn khác.

Ghi nhớ

⚠ Document Intelligence — các loại mô hình: | Loại | Nội dung | |---|---| | ⚠ Prebuilt models | ⚠ hoá đơn, biên lai, CMND, hộ chiếu, W-2, danh thiếp, hợp đồng | | ⚠ Layout model | ⚠ trích cấu trúc: bảng, đoạn, ô chọn | | ⚠ Read model | ⚠ OCR thuần | | ⚠ Custom models | ⚠ huấn luyện cho biểu mẫu RIÊNG của bạn | | ⚠ Composed models | ⚠ gộp nhiều custom model, tự chọn đúng loại |

Từ khoá nhận diện:

"trích trường từ biểu mẫu" → ⚠ Document Intelligence "chỉ cần lấy chữ ra" → ⚠ Computer Vision Read OCR "phân tích văn bản đã có" → ⚠ AI Language "biểu mẫu riêng của công ty" → ⚠ Custom model của Document Intelligence

⚠ Custom model — hai kiểu Kiểu
⚠ Custom template ⚠ biểu mẫu có BỐ CỤC CỐ ĐỊNH — cần ít mẫu (5)
⚠ Custom neural ⚠ bố cục THAY ĐỔI — linh hoạt hơn, cần nhiều mẫu hơn
⚠ Biểu mẫu bệnh viện ⚠ thường dùng template nếu form chuẩn hoá
⚠ Nhiều nguồn khác nhau ⚠ dùng neural
⚠ Chữ VIẾT TAY — điểm cần lưu ý Lưu ý
⚠ Document Intelligence đọc được chữ viết tay
⚠ Nhưng độ chính xác THẤP HƠN chữ in nhiều
⚠ Luôn trả về confidence cho từng trường
⚠ Thiết kế quy trình ⚠ confidence thấp → đưa người kiểm tra
⚠ Với dữ liệu y tế ⚠ ngưỡng phải cao, sai một chữ số mã bảo hiểm là hỏng
⚠ Quy trình xử lý biểu mẫu thực tế Quy trình
⚠ 1. Nhận biểu mẫu vào Blob Storage
⚠ 2. Trigger gọi Document Intelligence
⚠ 3. Kiểm tra confidence từng trường
⚠ 4. Cao → tự động vào hệ thống
⚠ 5. Thấp → hàng chờ người xác nhận
⚠ 6. Ghi lại các lần sửa để cải thiện mô hình

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Ngưỡng confidence đặt bao nhiêu | ⚠ dữ liệu y tế cần cao | | Có hàng chờ cho người kiểm tra không | | | Biểu mẫu có bố cục cố định không | ⚠ quyết định template hay neural |

Và thiết kế bắt buộc cho mọi hệ thống trích xuất tự động xử lý dữ liệu quan trọng: một đường dẫn cho con người xác nhận khi máy không chắc. Tự động hoá 90% một cách an toàn tốt hơn nhiều so với tự động hoá 100% và sai 5%.

Câu 7
A retail company wants to build a machine learning solution to predict customer purchasing patterns. The data science team needs a cloud-based platform where they can collaboratively develop, train, and deploy their models while having access to scalable compute resources and pre-built machine learning algorithms. Which Azure service should they use?
  1. A Azure Databricks
  2. B Azure Machine Learning
  3. C Azure Data Factory
  4. D Azure Synapse Analytics
Xem giải thích

Đáp án

B — Azure Machine Learning.

Vì sao đúng

⚠ Đề nêu bốn nhu cầu, Azure ML đáp ứng cả bốn: | Nhu cầu | Azure ML | |---|---| | ⚠ Nền tảng CỘNG TÁC | ⚠ workspace dùng chung, quản lý phiên bản | | ⚠ Phát triển, huấn luyện, TRIỂN KHAI | ⚠ phủ toàn bộ vòng đời | | ⚠ Tài nguyên tính toán CO GIÃN | ⚠ compute cluster tự co giãn | | ⚠ Thuật toán DỰNG SẴN | ⚠ AutoML và designer có sẵn thuật toán |

⚠ Azure ML Workspace
   ├── ⚠ Notebooks — phát triển
   ├── ⚠ Compute — cluster co giãn
   ├── ⚠ Datasets — quản dữ liệu
   ├── ⚠ Experiments — theo dõi thử nghiệm
   ├── ⚠ Models — registry mô hình
   ├── ⚠ Endpoints — triển khai
   └── ⚠ Pipelines — tự động hoá

Vì sao các phương án khác sai

  • A (Azure Databricks) — ⚠ rất mạnh và cũng làm được ML: ⚠ nhưng ⚠ thiên về xử lý dữ liệu lớn bằng Spark; ⚠ phần vòng đời mô hình và triển khai endpoint không đầy đủ bằng Azure ML.

  • D (Azure Synapse Analytics) — ⚠ kho dữ liệu và phân tích: ⚠ có tích hợp ML nhưng không phải nền tảng ML chính.

  • C (Azure Data Factory) — ⚠ công cụ ETL: ⚠ chuyển và biến đổi dữ liệu, ⚠ không huấn luyện mô hình.

Ghi nhớ

⚠ Azure Machine Learning — thành phần chính: | Thành phần | Việc | |---|---| | ⚠ Workspace | ⚠ không gian làm việc chung | | ⚠ Compute instance / cluster | ⚠ máy phát triển và cụm huấn luyện | | ⚠ Datasets / Data assets | ⚠ quản lý dữ liệu có phiên bản | | ⚠ AutoML | ⚠ tự thử nhiều thuật toán và siêu tham số | | ⚠ Designer | ⚠ kéo thả, không cần viết mã | | ⚠ Model registry | ⚠ lưu và quản phiên bản mô hình | | ⚠ Endpoints | ⚠ triển khai real-time hoặc batch | | ⚠ Pipelines | ⚠ tự động hoá quy trình MLOps |

Từ khoá nhận diện:

"nền tảng ML đầy đủ, cộng tác, triển khai" → ⚠ Azure Machine Learning "xử lý dữ liệu lớn bằng Spark" → ⚠ Databricks "kho dữ liệu và phân tích" → ⚠ Synapse "ETL, chuyển dữ liệu" → ⚠ Data Factory

⚠ Ba cách xây mô hình trong Azure ML Cách
⚠ AutoML ⚠ không cần biết ML — chọn dữ liệu và mục tiêu
⚠ Designer ⚠ kéo thả module
⚠ Notebook / SDK ⚠ viết mã Python, toàn quyền
⚠ Chọn theo ⚠ kỹ năng của đội và mức tuỳ biến cần thiết
⚠ AutoML làm gì Việc
⚠ Tự thử nhiều thuật toán
⚠ Tự dò siêu tham số
⚠ Tự chuẩn hoá và mã hoá đặc trưng
⚠ Xếp hạng mô hình theo chỉ số
⚠ Sinh mã của mô hình tốt nhất ⚠ xem và sửa được
⚠ Giá trị lớn nhất ⚠ cho một BASELINE nhanh để so sánh
⚠ Hai loại endpoint Loại
⚠ Real-time (online) ⚠ API trả kết quả ngay, cho ứng dụng
⚠ Batch ⚠ xử lý khối lượng lớn theo lô
⚠ Chọn ⚠ dự đoán khi người dùng thao tác → real-time; chấm điểm cả tập → batch

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đã chạy AutoML lấy baseline chưa | | | Compute cluster có tự thu về 0 khi rảnh không | ⚠ tránh trả tiền vô ích | | Có theo dõi trôi mô hình sau khi triển khai không | |

Và cấu hình tiết kiệm chi phí quan trọng nhất trong Azure ML: đặt số node tối thiểu của compute cluster về 0. Một cụm huấn luyện quên tắt sẽ tính tiền suốt cuối tuần dù không chạy gì.

Câu 8
You are developing a machine learning model to predict customer churn for a telecommunications company. You have a dataset of 10,000 customer records with historical data. After building your initial model using 7,000 records, you test it against the remaining 3,000 records and discover that it performs significantly worse on the new data compared to the data used during training. What is the most likely cause of this issue?
  1. A The validation dataset should have been used during training instead of after training was complete.
  2. B The training dataset was too large, causing the model to learn too slowly.
  3. C The model was overfitted to the training dataset and does not generalize well to new data.
  4. D The model requires more validation data and less training data to improve accuracy.
Xem giải thích

Đáp án

C — Mô hình bị QUÁ KHỚP với tập huấn luyện và không tổng quát hoá tốt sang dữ liệu mới.

Vì sao đúng

⚠ Triệu chứng trong đề là định nghĩa sách giáo khoa của quá khớp: | Triệu chứng | Kết luận | |---|---| | ⚠ Tốt trên 7.000 bản ghi huấn luyện | | | ⚠ TỆ HƠN HẲN trên 3.000 bản ghi kiểm tra | ⚠ QUÁ KHỚP |

⚠ Mô hình HỌC THUỘC dữ liệu huấn luyện
   ⚠ nhớ cả nhiễu, cả trường hợp cá biệt
        ↓
⚠ Gặp dữ liệu mới
        ↓
⚠ Không có quy luật chung để áp dụng
        ↓
⚠ Hiệu năng sụt giảm

⚠ Khoảng cách giữa hiệu năng train và test chính là thước đo mức độ quá khớp.

Vì sao các phương án khác sai

  • A (nên dùng tập kiểm định TRONG lúc huấn luyện thay vì sau) — ⚠ đúng là thực hành tốt nhưng KHÔNG phải nguyên nhân: ⚠ dùng validation set giúp PHÁT HIỆN sớm, ⚠ không phải lý do mô hình quá khớp.

  • B (tập huấn luyện quá lớn khiến mô hình học chậm) — ⚠ vô lý: ⚠ nhiều dữ liệu hơn ⚠ giảm quá khớp, không gây ra nó.

  • D (cần nhiều dữ liệu kiểm định và ít dữ liệu huấn luyện hơn) — ⚠ ngược hướng: ⚠ giảm dữ liệu huấn luyện làm ⚠ quá khớp NẶNG HƠN.

Ghi nhớ

⚠ Chẩn đoán từ hai con số — bảng phải thuộc: | Train | Test | Kết luận | |---|---|---| | ⚠ CAO | ⚠ THẤP | ⚠ QUÁ KHỚP | | ⚠ THẤP | ⚠ THẤP | ⚠ CHƯA KHỚP | | ⚠ CAO | ⚠ CAO | ⚠ tốt | | ⚠ THẤP | ⚠ CAO | ⚠ bất thường — kiểm tra lại cách chia dữ liệu |

Từ khoá nhận diện:

"tốt trên train, tệ trên test" → ⚠ quá khớp "tệ trên cả hai" → ⚠ chưa khớp "tốt khi thử, tệ trong sản xuất" → ⚠ quá khớp HOẶC trôi dữ liệu

⚠ Cách chữa quá khớp Cách
⚠ THÊM dữ liệu huấn luyện ⚠ hiệu quả nhất nếu làm được
⚠ Regularization L1/L2
⚠ Dropout ⚠ cho mạng nơ-ron
⚠ Early stopping ⚠ dừng khi lỗi validation bắt đầu tăng
⚠ Giảm độ phức tạp mô hình
⚠ Cross-validation ⚠ đánh giá đáng tin hơn
⚠ Bớt đặc trưng thừa
⚠ Chia dữ liệu đúng cách Cách chia
⚠ Train (~70%) ⚠ huấn luyện
⚠ Validation (~15%) ⚠ chỉnh siêu tham số, phát hiện quá khớp SỚM
⚠ Test (~15%) ⚠ đánh giá CUỐI CÙNG, chỉ dùng MỘT LẦN
⚠ Sai lầm nghiêm trọng ⚠ dùng tập test để chỉnh mô hình — kết quả không còn khách quan
⚠ Rò rỉ dữ liệu — nguyên nhân dễ bị bỏ qua Rò rỉ
⚠ Đặc trưng chứa thông tin từ TƯƠNG LAI ⚠ cột "đã huỷ dịch vụ" trong bài toán dự đoán rời bỏ
⚠ Chuẩn hoá dữ liệu TRƯỚC khi chia tập ⚠ thông tin test lọt vào train
⚠ Bản ghi trùng nằm ở cả hai tập
⚠ Triệu chứng ⚠ kết quả đẹp bất thường lúc thử, sụp đổ khi lên sản xuất

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Khoảng cách train và test là bao nhiêu | ⚠ thước đo quá khớp | | Có rò rỉ dữ liệu không | ⚠ kiểm tra từng đặc trưng | | Đã thử cross-validation chưa | |

Và điều đáng nghi khi một mô hình cho kết quả đẹp bất ngờ ngay lần đầu: rất có thể có rò rỉ dữ liệu. Một mô hình dự đoán rời bỏ đạt 99% thường không giỏi — nó chỉ đang nhìn thấy một cột mà đáng lẽ không được nhìn.

Câu 9
A retail company wants to automatically analyze customer feedback from online reviews to determine whether customers are satisfied or dissatisfied with their products. The solution should categorize reviews as positive, negative, or neutral without requiring manual review of each submission. Which type of AI workload does this scenario represent?
  1. A Computer Vision
  2. B Object Detection
  3. C Sentiment Analysis
  4. D Anomaly Detection
Xem giải thích

Đáp án

C — Sentiment Analysis (phân tích cảm xúc).

Vì sao đúng

⚠ Đề mô tả chính xác định nghĩa: | Đề nói | Sentiment Analysis | |---|---| | ⚠ "phân tích phản hồi khách hàng" | ⚠ đầu vào là VĂN BẢN | | ⚠ "hài lòng hay không hài lòng" | ⚠ đánh giá THÁI ĐỘ | | ⚠ "tích cực, tiêu cực, trung tính" | ⚠ đúng ba nhãn chuẩn |

⚠ "Sản phẩm tuyệt vời, giao nhanh"
        ↓ ⚠ Sentiment Analysis
⚠ positive: 0.95

⚠ "Hàng hỏng, đóng gói cẩu thả"
        ↓
⚠ negative: 0.98

⚠ Đây là một tác vụ của Xử lý Ngôn ngữ Tự nhiên (NLP).

Vì sao các phương án khác sai

  • A (Computer Vision) — ⚠ xử lý ẢNH và VIDEO: ⚠ đề là văn bản.

  • B (Object Detection) — ⚠ tìm và định vị đối tượng trong ảnh: ⚠ một nhánh của computer vision.

  • D (Anomaly Detection) — ⚠ phát hiện điểm dữ liệu BẤT THƯỜNG: ⚠ ví dụ giao dịch gian lận, cảm biến hỏng; ⚠ không phải đánh giá thái độ.

Ghi nhớ

⚠ Các loại workload AI — bảng phải thuộc: | Workload | Đầu vào | Ví dụ | |---|---|---| | ⚠ Computer Vision | ⚠ ảnh, video | ⚠ phân loại ảnh, phát hiện đối tượng, OCR | | ⚠ NLP | ⚠ văn bản, giọng nói | ⚠ cảm xúc, dịch, tóm tắt, thực thể | | ⚠ Anomaly Detection | ⚠ chuỗi số, chuỗi thời gian | ⚠ gian lận, lỗi thiết bị | | ⚠ Knowledge Mining | ⚠ tài liệu | ⚠ tìm kiếm và trích xuất tri thức | | ⚠ Generative AI | ⚠ prompt | ⚠ sinh văn bản, ảnh, mã | | ⚠ Document Intelligence | ⚠ biểu mẫu | ⚠ trích trường |

Từ khoá nhận diện:

"tích cực/tiêu cực, hài lòng" → ⚠ Sentiment Analysis (NLP) "tìm vật thể trong ảnh" → ⚠ Object Detection (Computer Vision) "phát hiện bất thường trong số liệu" → ⚠ Anomaly Detection "trả lời câu hỏi từ tài liệu" → ⚠ Knowledge Mining hoặc question answering

⚠ Sentiment Analysis trong Azure AI Language Chi tiết
⚠ Trả về ba điểm ⚠ positive, neutral, negative — cộng lại bằng 1
⚠ Phân tích ở mức CÂU và mức TÀI LIỆU
⚠ Opinion Mining ⚠ gắn cảm xúc với KHÍA CẠNH cụ thể
⚠ Opinion Mining rất hữu ích ⚠ "đồ ăn ngon nhưng phục vụ chậm" → tách được hai ý
⚠ Vì sao Opinion Mining giá trị hơn sentiment đơn thuần Lý do
⚠ Một đánh giá thường có nhiều khía cạnh
⚠ Điểm tổng thể "trung tính" che mất thông tin
⚠ Doanh nghiệp cần biết CÁI GÌ tốt, CÁI GÌ tệ
⚠ Ví dụ ⚠ "giao hàng nhanh nhưng đóng gói tệ" — hai hành động khác nhau
⚠ Hạn chế của phân tích cảm xúc tự động Hạn chế
⚠ Mỉa mai và châm biếm ⚠ "tuyệt vời, lại hỏng nữa" → mô hình dễ đọc là tích cực
⚠ Ngữ cảnh văn hoá
⚠ Phủ định phức tạp
⚠ Tiếng lóng và viết tắt
⚠ Nên ⚠ kiểm tra trên dữ liệu THẬT của mình, đừng tin điểm benchmark

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Độ chính xác trên đánh giá thật là bao nhiêu | ⚠ lấy mẫu và đối chiếu tay | | Có cần Opinion Mining không | ⚠ thường có | | Mô hình xử lý tiếng Việt tốt tới đâu | |

Và điều đáng làm trước khi tin vào bất kỳ hệ thống phân tích cảm xúc nào: lấy một trăm đánh giá thật, tự gán nhãn, rồi so với kết quả của máy. Con số thu được thường khác xa những gì tài liệu quảng cáo.

Câu 10
A retail company has collected data about customer purchasing behavior over the past year. They want to use machine learning to group customers based on similarities in their shopping patterns, such as frequency of purchases, average transaction value, and product categories purchased. The company has no predefined customer categories and wants the system to discover natural groupings in the data. Which type of machine learning should they use?
  1. A Regression
  2. B Clustering
  3. C Multi-class classification
  4. D Binary classification
Xem giải thích

Đáp án

B — Clustering (phân cụm).

Vì sao đúng

⚠ Cụm từ quyết định trong đề: "KHÔNG có danh mục định sẵn, muốn hệ thống TỰ TÌM RA nhóm tự nhiên".

⚠ KHÔNG có nhãn
        ↓
⚠ Học KHÔNG giám sát
        ↓
⚠ Clustering
        ↓
⚠ Máy tự nhóm khách hàng
   theo mức độ giống nhau
Đặc trưng đầu vào Ví dụ
⚠ Tần suất mua
⚠ Giá trị giao dịch trung bình
⚠ Danh mục sản phẩm mua
⚠ Kết quả ⚠ các nhóm khách hàng, máy tự phát hiện

Vì sao các phương án khác sai

  • C (multi-class classification) và D (binary classification) — ⚠ đều là học CÓ GIÁM SÁT: ⚠ đòi hỏi ⚠ NHÃN có sẵn; ⚠ đề nói rõ không có danh mục định trước.

  • A (regression) — ⚠ dự đoán một CON SỐ liên tục: ⚠ đề không dự đoán số nào.

Ghi nhớ

⚠ Ba nhóm học máy — bảng phải thuộc: | Nhóm | Có nhãn | Ví dụ | |---|---|---| | ⚠ Có giám sát | ⚠ CÓ | ⚠ hồi quy, phân loại | | ⚠ Không giám sát | ⚠ KHÔNG | ⚠ phân cụm, giảm chiều | | ⚠ Tăng cường | ⚠ học từ phần thưởng | ⚠ robot, trò chơi |

Từ khoá nhận diện:

"không có nhãn, tự tìm nhóm" → ⚠ clustering "phân vào các loại ĐÃ BIẾT" → ⚠ classification "dự đoán một con số" → ⚠ regression "phân khúc khách hàng" → ⚠ gần như luôn là clustering

⚠ Thuật toán phân cụm phổ biến Thuật toán
⚠ K-means ⚠ phổ biến nhất — phải chọn K trước
⚠ Hierarchical ⚠ tạo cây phân cấp, không cần chọn K
⚠ DBSCAN ⚠ theo mật độ, tự tìm số cụm, chịu được nhiễu
⚠ Chọn K thế nào ⚠ elbow method, silhouette score
⚠ Sau khi phân cụm thì làm gì Làm gì
⚠ ĐẶT TÊN cho từng cụm ⚠ máy chỉ cho ra cụm 0, 1, 2 — người phải diễn giải
⚠ Phân tích đặc điểm mỗi cụm ⚠ "cụm 1 = khách mua nhiều, giá trị cao"
⚠ Thiết kế chiến lược riêng cho từng nhóm
⚠ Bước diễn giải ⚠ là phần QUAN TRỌNG NHẤT và cần con người
⚠ Chuẩn bị dữ liệu cho phân cụm Chuẩn bị
⚠ CHUẨN HOÁ các đặc trưng ⚠ BẮT BUỘC — nếu không, cột giá trị lớn sẽ áp đảo
⚠ Xử lý giá trị ngoại lai ⚠ K-means rất nhạy với chúng
⚠ Chọn đặc trưng có ý nghĩa nghiệp vụ
⚠ Lỗi phổ biến nhất ⚠ quên chuẩn hoá — cột "doanh thu" (hàng triệu) nuốt chửng cột "số lần mua" (hàng chục)
⚠ Đánh giá chất lượng phân cụm Đánh giá
⚠ Silhouette score ⚠ cụm tách bạch tới đâu
⚠ Elbow method ⚠ chọn số cụm hợp lý
⚠ Ý nghĩa NGHIỆP VỤ ⚠ quan trọng nhất — cụm có giải thích được không
⚠ Cụm đẹp về toán học ⚠ vô dụng nếu không ai hiểu nó nghĩa là gì

Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đặc trưng đã chuẩn hoá chưa | ⚠ lỗi số một | | Số cụm có hợp lý về nghiệp vụ không | | | Mỗi cụm có đặt tên và mô tả được không | |

Và bước biến một kết quả phân cụm thành giá trị kinh doanh: diễn giải từng cụm thành một chân dung khách hàng. Máy trả về "cụm 0, 1, 2"; công việc của con người là biến chúng thành "khách trung thành", "khách săn khuyến mãi", "khách sắp rời bỏ".