Ngân hàng đề — Microsoft Azure AI Fundamentals
Tìm thấy 316 câu.
- A Azure Machine Learning does not allow for version control of models.
- B Azure Machine Learning only supports deployment of models trained on Azure.
- C Azure Machine Learning supports deployment of models as web services.
- D Azure Machine Learning requires manual configuration for scaling deployed models.
Xem giải thích
Đáp án
C — Azure Machine Learning hỗ trợ TRIỂN KHAI mô hình thành DỊCH VỤ WEB.
Vì sao đúng
⚠ Triển khai là bước biến mô hình thành thứ dùng được:
⚠ Mô hình đã huấn luyện
↓ ⚠ đăng ký vào registry
⚠ Tạo endpoint
↓
⚠ REST API có URL và khoá
↓
⚠ Ứng dụng gọi và nhận dự đoán
| Loại endpoint | Dùng khi |
|---|---|
| ⚠ Managed online endpoint | ⚠ dự đoán THỜI GIAN THỰC, từng yêu cầu |
| ⚠ Batch endpoint | ⚠ chấm điểm hàng loạt theo lô |
| ⚠ Triển khai ra Kubernetes | ⚠ cần kiểm soát hạ tầng |
| ⚠ Xuất ra thiết bị biên | ⚠ IoT Edge, ONNX |
Vì sao các phương án khác sai
-
A (không quản lý phiên bản mô hình) — ⚠ SAI: ⚠ model registry ⚠ đánh phiên bản tự động.
-
B (chỉ triển khai được mô hình huấn luyện TRÊN Azure) — ⚠ SAI: ⚠ đăng ký và triển khai được mô hình huấn luyện ở nơi khác.
-
D (phải cấu hình co giãn THỦ CÔNG) — ⚠ SAI: ⚠ managed endpoint có ⚠ tự co giãn.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ gần trùng #17994 ở đợt trước — ⚠ #17994 hỏi nơi lưu mô hình đã huấn luyện (model registry), ⚠ câu này hỏi tính năng triển khai; ⚠ hai bước liên tiếp của cùng quy trình.
⚠ Vòng đời MLOps trong Azure ML: | Bước | Nội dung | |---|---| | ⚠ Chuẩn bị dữ liệu | ⚠ data asset | | ⚠ Huấn luyện | ⚠ job trên compute cluster | | ⚠ Đăng ký mô hình | ⚠ registry, có phiên bản | | ⚠ Triển khai | ⚠ endpoint | | ⚠ Giám sát | ⚠ drift, hiệu năng | | ⚠ Huấn luyện lại | ⚠ pipeline tự động |
Từ khoá nhận diện:
"gọi từ ứng dụng, trả kết quả ngay" → ⚠ online endpoint "chấm điểm hàng triệu bản ghi qua đêm" → ⚠ batch endpoint "quản lý phiên bản mô hình" → ⚠ model registry "chạy trên thiết bị không có mạng" → ⚠ triển khai ra biên
| ⚠ Triển khai xanh-lam — tính năng đáng nhớ | Nội dung |
|---|---|
| ⚠ Một endpoint chứa NHIỀU deployment | |
| ⚠ Chia phần trăm lưu lượng giữa chúng | |
| ⚠ Cho mô hình mới nhận 10% trước | |
| ⚠ Theo dõi rồi mới chuyển hết | |
| ⚠ Quay lui | ⚠ chỉ cần đổi lại tỉ lệ lưu lượng |
| ⚠ Điều phải chuẩn bị khi triển khai | Việc |
|---|---|
| ⚠ Script chấm điểm (init và run) | |
| ⚠ Môi trường với đúng thư viện | |
| ⚠ Cấu hình máy và số bản sao | |
| ⚠ Cách xác thực: khoá hay token | |
| ⚠ Lỗi hay gặp | ⚠ môi trường triển khai khác môi trường huấn luyện |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Cần dự đoán ngay hay theo lô | | | Có kế hoạch quay lui khi mô hình mới tệ hơn không | | | Môi trường triển khai có khớp môi trường huấn luyện không | |
Và nguyên nhân phổ biến nhất khiến một mô hình chạy tốt trong notebook mà hỏng ngay khi triển khai: môi trường thư viện khác nhau. Ghim phiên bản môi trường ngay từ lúc huấn luyện là cách rẻ nhất để tránh cả một buổi chiều gỡ lỗi.
- A Automatically building chatbots
- B Monitoring multi-dimensional metrics and detecting anomalies
- C Deploying and managing machine learning models
- D Providing a search-as-a-service solution
Xem giải thích
Đáp án
B — Giám sát các chỉ số ĐA CHIỀU và phát hiện bất thường.
Vì sao đúng
⚠ Metrics Advisor sinh ra cho dữ liệu chỉ số có nhiều chiều:
⚠ Doanh thu
⚠ chia theo VÙNG × SẢN PHẨM × KÊNH
↓
⚠ Hàng nghìn chuỗi số cùng lúc
↓ ⚠ Metrics Advisor
⚠ Phát hiện chuỗi nào bất thường
⚠ Gom cảnh báo liên quan lại
⚠ Chỉ ra chiều nào gây ra vấn đề
| Năng lực | Nội dung |
|---|---|
| ⚠ Nạp dữ liệu từ nhiều nguồn | |
| ⚠ Tự chọn mô hình phát hiện phù hợp | |
| ⚠ Phân tích NGUYÊN NHÂN GỐC theo chiều | |
| ⚠ Gửi cảnh báo qua email, webhook, Teams | |
| ⚠ Nhận phản hồi để chỉnh độ nhạy |
Vì sao các phương án khác sai
-
C (triển khai và quản lý mô hình) — ⚠ Azure Machine Learning.
-
D (tìm kiếm dạng dịch vụ) — ⚠ Azure AI Search.
-
A (tự dựng chatbot) — ⚠ Bot Service hoặc Copilot Studio.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ dịch vụ trong khoá ⚠ đã thông báo ngừng hoạt động.
| Vấn đề | Thực tế |
|---|---|
| ⚠ Azure AI Metrics Advisor | ⚠ Microsoft thông báo NGỪNG, dừng hẳn tháng 10/2026 |
| ⚠ Ngừng nhận khách hàng mới | |
| ⚠ Cùng đợt với Anomaly Detector và Personalizer | |
| ⚠ Thay thế | ⚠ Azure Monitor, hoặc tự xây trên Azure ML |
| ⚠ Giữ nguyên khoá | ⚠ B — KHÔNG sửa, vẫn là đáp án đúng của câu hỏi |
| ⚠ Đối chiếu | ⚠ #18053 (Personalizer) và #18063 (Anomaly Detector) cùng đợt |
⚠ Ba dịch vụ giám sát bất thường của Azure — phân biệt: | Dịch vụ | Phạm vi | |---|---| | ⚠ Anomaly Detector | ⚠ MỘT chuỗi thời gian, API đơn giản | | ⚠ Metrics Advisor | ⚠ NHIỀU chiều, có quản lý cảnh báo | | ⚠ Azure Monitor | ⚠ giám sát hạ tầng và ứng dụng |
Từ khoá nhận diện:
"chỉ số đa chiều, phân tích nguyên nhân gốc" → ⚠ Metrics Advisor "một chuỗi số, phát hiện điểm lạ" → ⚠ Anomaly Detector "CPU, bộ nhớ, log ứng dụng" → ⚠ Azure Monitor
| ⚠ Phân tích nguyên nhân gốc — điểm mạnh riêng | Nội dung |
|---|---|
| ⚠ Doanh thu tổng giảm 5% | |
| ⚠ Đào xuống theo chiều: vùng nào, sản phẩm nào | |
| ⚠ Tìm ra nhánh gây ra phần lớn mức giảm | |
| ⚠ Giá trị | ⚠ rút ngắn thời gian từ "có vấn đề" tới "biết vấn đề ở đâu" |
| ⚠ Bài học rút ra khi dịch vụ bị ngừng | Bài học |
|---|---|
| ⚠ Dịch vụ AI chuyên biệt có thể bị gộp hoặc bỏ | |
| ⚠ Nên tách phần logic nghiệp vụ khỏi lời gọi API | |
| ⚠ Ghi rõ dịch vụ nào đang phụ thuộc | |
| ⚠ Với kỳ thi | ⚠ vẫn phải nhớ tên và chức năng vì đề chưa cập nhật |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Dịch vụ trong đề còn được hỗ trợ không | | | Cần một chuỗi hay nhiều chiều | | | Ai nhận cảnh báo và xử lý thế nào | |
Và điều đáng rút ra khi một dịch vụ đám mây bị khai tử giữa vòng đời sản phẩm: phần khó thay thế không phải lời gọi API mà là quy trình cảnh báo và con người đã quen với nó. Tách hai lớp đó ra từ đầu giúp việc chuyển đổi rẻ hơn nhiều.
- A Automated Investigation and Response
- B Threat Prevention
- C Secure Score
- D Endpoint Detection and Response
Xem giải thích
Đáp án
D — Endpoint Detection and Response (EDR)
Vì sao đúng
EDR dựng riêng để phát hiện tấn công tinh vi trên chính máy chủ: nó theo dõi liên tục hành vi của tiến trình, lời gọi hệ thống và kết nối mạng, rồi nhận ra chuỗi hành vi đáng ngờ mà từng hành động riêng lẻ trông vẫn bình thường. Đó là loại tấn công mà chữ ký virus truyền thống không bắt được.
Vì sao các phương án khác sai
- B. Threat Prevention — ngăn chặn mối đe doạ đã biết trước khi chúng chạy; không phát hiện được thứ chưa có chữ ký.
- A. Automated Investigation and Response — chạy sau khi đã phát hiện, để điều tra và xử lý.
- C. Secure Score — chấm điểm tư thế bảo mật, mang tính đánh giá chứ không phát hiện tấn công đang diễn ra.
- A Identifying the sentiment of a customer review.
- B Predicting whether an email is spam or not.
- C Classifying images of cats and dogs.
- D Predicting the sales of a retail store in the next quarter.
Xem giải thích
Đáp án
D — Dự đoán doanh số của một cửa hàng bán lẻ trong quý tới.
Vì sao đúng
⚠ Doanh số là con số liên tục — hồi quy:
⚠ Đặc trưng
⚠ doanh số các quý trước
⚠ mùa vụ, khuyến mãi, số cửa hàng
↓
⚠ 4,7 tỷ đồng
↓
⚠ CON SỐ → hồi quy
Vì sao các phương án khác sai
-
B (email có phải spam không) — ⚠ phân loại nhị phân.
-
C (phân loại ảnh mèo và chó) — ⚠ phân loại ảnh.
-
A (xác định cảm xúc của một đánh giá) — ⚠ phân loại vào tích cực / tiêu cực / trung tính.
⚠ Cả ba đều cho ra NHÃN, không phải số.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ đây là câu ⚠ thứ tư cùng một khuôn trong đợt này.
| Câu | Hỏi | Khoá |
|---|---|---|
| ⚠ #18024 | ⚠ ví dụ hồi quy | ⚠ dự báo giá cổ phiếu |
| ⚠ #18034 | ⚠ ví dụ phân loại | ⚠ lọc thư rác |
| ⚠ #18049 | ⚠ ví dụ gom cụm | ⚠ phân khúc khách hàng |
| ⚠ #18058 (câu này) | ⚠ ví dụ hồi quy | ⚠ dự báo doanh số |
| ⚠ Nhận xét | ⚠ bốn câu DÙNG CHUNG bộ phương án, chỉ đổi câu hỏi | |
| ⚠ Mẹo | ⚠ nắm chắc bảng đầu ra là ăn trọn cả nhóm câu này |
⚠ Bảng đầu ra — học một lần dùng cho cả nhóm: | Ví dụ trong bộ đề | Bài toán | |---|---| | ⚠ Doanh số quý tới | ⚠ regression | | ⚠ Giá cổ phiếu | ⚠ regression | | ⚠ Email có phải spam | ⚠ classification | | ⚠ Ảnh mèo hay chó | ⚠ classification | | ⚠ Cảm xúc đánh giá | ⚠ classification | | ⚠ Nhóm khách theo hành vi mua | ⚠ clustering | | ⚠ Giao dịch bất thường | ⚠ anomaly detection |
Từ khoá nhận diện:
"bao nhiêu tiền, bao nhiêu đơn" → ⚠ regression "có phải, thuộc loại nào" → ⚠ classification "tự chia nhóm" → ⚠ clustering "quý tới, tháng tới" → ⚠ forecasting, một dạng hồi quy
| ⚠ Dự báo doanh số bán lẻ — đặc thù | Đặc thù |
|---|---|
| ⚠ Có tính MÙA VỤ mạnh | ⚠ Tết, lễ, cuối tuần |
| ⚠ Chịu ảnh hưởng khuyến mãi và giá | |
| ⚠ Ngày lễ khác nhau giữa các năm dương lịch | ⚠ Tết âm lịch |
| ⚠ Đặc trưng nên có | ⚠ cờ ngày lễ, tuần trong năm, có khuyến mãi hay không |
| ⚠ Chia tập | ⚠ theo THỜI GIAN, không ngẫu nhiên |
| ⚠ Sai số bao nhiêu là dùng được | Cách nghĩ |
|---|---|
| ⚠ So với cách dự báo đơn giản nhất | ⚠ lấy cùng kỳ năm trước |
| ⚠ Mô hình phải THẮNG được mốc đó | |
| ⚠ Nếu không thắng | ⚠ không đáng triển khai và bảo trì |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đầu ra là số hay nhãn | | | Đã có mốc so sánh đơn giản chưa | | | Đặc trưng mùa vụ đã đưa vào chưa | |
Và bước đầu tiên nên làm trước mọi mô hình dự báo, thường bị bỏ qua vì trông quá đơn giản: dựng một mốc so sánh ngây thơ như lấy số cùng kỳ năm trước. Không thắng được nó thì mô hình phức tạp chỉ tạo thêm việc bảo trì.
- A Object detection and object recognition are not used in computer vision workloads.
- B Object detection and object recognition are interchangeable terms that refer to the same process.
- C Object detection identifies the type of objects in an image, while object recognition identifies the location of objects in an image.
- D Object detection identifies the location of objects in an image, while object recognition identifies the type of objects in an image.
Xem giải thích
Đáp án
D — Object detection xác định VỊ TRÍ của các vật trong ảnh, còn object recognition xác định LOẠI của chúng.
Vì sao đúng
⚠ Theo cách phân chia mà bộ đề dùng: | Thuật ngữ | Trả lời câu hỏi | |---|---| | ⚠ Detection | ⚠ Ở ĐÂU — hộp bao, toạ độ | | ⚠ Recognition | ⚠ LÀ GÌ — nhãn của vật |
⚠ Ảnh vào
↓ ⚠ DETECTION
⚠ "Có vật tại (120, 80, 200, 180)"
↓ ⚠ RECOGNITION
⚠ "Vật đó là con mèo"
Vì sao các phương án khác sai
-
C — ⚠ đảo ngược hai vế; ⚠ bẫy đối xứng, đọc lướt rất dễ chọn.
-
B (hai thuật ngữ dùng thay nhau được) — ⚠ SAI: ⚠ chúng trả lời hai câu hỏi khác nhau.
-
A (không dùng trong thị giác máy tính) — ⚠ SAI rõ ràng.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ ranh giới này ⚠ không thống nhất trong tài liệu ngành.
| Vấn đề | Thực tế |
|---|---|
| ⚠ Nhiều tài liệu coi "object detection" gồm CẢ định vị và phân loại | |
| ⚠ "Object recognition" thường được dùng như từ chung | |
| ⚠ Bộ đề tách hai khái niệm theo kiểu vị trí / loại | |
| ⚠ Trong phòng thi | ⚠ theo cách tách của đề: detection = VỊ TRÍ, recognition = LOẠI |
| ⚠ Giữ nguyên khoá | ⚠ D theo bộ đề gốc |
| ⚠ Đối chiếu | ⚠ #18023 và #18052 cùng đợt, nơi detection được mô tả gồm cả hai |
⚠ Thuật ngữ thị giác — bảng an toàn cho đề thi: | Thuật ngữ | Trong đề này | |---|---| | ⚠ Image classification | ⚠ một nhãn cho cả ảnh | | ⚠ Object detection | ⚠ vị trí, hộp bao | | ⚠ Object recognition | ⚠ loại của vật | | ⚠ Segmentation | ⚠ từng pixel | | ⚠ Facial recognition | ⚠ danh tính người |
Từ khoá nhận diện:
"ở đâu, toạ độ, hộp bao" → ⚠ detection "là gì, loại nào" → ⚠ recognition / classification "đường viền chính xác" → ⚠ segmentation "là AI" → ⚠ facial recognition
| ⚠ Cách làm câu "khác biệt chính giữa A và B" | Cách |
|---|---|
| ⚠ Đề luôn có MỘT cặp đúng và MỘT cặp đảo ngược | |
| ⚠ Xác định vế nào thuộc khái niệm nào TRƯỚC | |
| ⚠ Rồi mới tìm phương án khớp | |
| ⚠ Sai phổ biến | ⚠ đọc lướt, thấy đủ từ khoá quen là chọn |
| ⚠ Dạng này xuất hiện | ⚠ rất nhiều trong bộ đề, xem #18025, #18038, #18061 |
| ⚠ Trong thực tế Azure thì sao | Thực tế |
|---|---|
| ⚠ Custom Vision object detection trả CẢ hộp bao LẪN nhãn | |
| ⚠ Không có dịch vụ nào chỉ làm một nửa | |
| ⚠ Nghĩa là | ⚠ phân chia này mang tính học thuật, không phản ánh sản phẩm |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đề hỏi vị trí hay loại | | | Phương án có bị đảo vế không | ⚠ đọc kỹ cả hai vế | | Trong thực tế cần cả hai không | |
Và dạng câu hỏi lặp đi lặp lại trong bộ đề này, đáng luyện riêng: "khác biệt chính giữa A và B" luôn kèm một phương án đảo ngược hai vế. Xác định đúng vế trước khi đọc phương án là cách tránh bẫy chắc chắn nhất.
- A Ignoring demographic information to ensure unbiased results
- B Conducting regular data audits to identify and address any bias in training data
- C Optimizing models for maximum output speed and performance
- D Prioritizing the generation of creative and diverse content over accuracy
Xem giải thích
Đáp án
B — Kiểm tra dữ liệu định kỳ để phát hiện và xử lý thiên lệch trong dữ liệu huấn luyện
Vì sao đúng
Thiên lệch của mô hình gần như luôn bắt nguồn từ dữ liệu huấn luyện, nên đó là chỗ phải xử lý. Rà soát định kỳ là cần thiết vì thiên lệch không tĩnh: dữ liệu mới được thêm vào, phân bố người dùng thay đổi, và mô hình được huấn luyện lại — mỗi lần đều có thể sinh ra thiên lệch mới.
Vì sao các phương án khác sai
- A. Bỏ qua thông tin nhân khẩu để đảm bảo không thiên lệch — đây là hiểu nhầm phổ biến và nguy hiểm: bỏ trường "giới tính" không xoá được thiên lệch, vì mô hình vẫn suy ra được nó từ các trường tương quan. Tệ hơn, bỏ trường đi thì bạn mất luôn khả năng đo xem mô hình có đối xử khác nhau giữa các nhóm hay không.
- C. Tối ưu tốc độ và hiệu năng — không liên quan tới công bằng.
- D. Ưu tiên nội dung sáng tạo hơn độ chính xác — đánh đổi sai hướng.
- A Sentiment analysis and key phrase extraction are not used in natural language processing workloads.
- B Sentiment analysis and key phrase extraction are interchangeable terms that refer to the same process.
- C Sentiment analysis identifies the most important phrases in a text, while key phrase extraction identifies the overall sentiment of a text.
- D Sentiment analysis identifies the overall sentiment of a text, while key phrase extraction identifies the most important phrases in a text.
Xem giải thích
Đáp án
D — Phân tích cảm xúc xác định CẢM XÚC TỔNG THỂ của văn bản, còn trích cụm từ khoá xác định các CỤM TỪ QUAN TRỌNG NHẤT.
Vì sao đúng
⚠ Hai tính năng, hai câu hỏi khác nhau:
⚠ "Giao hàng nhanh nhưng đóng gói tệ,
hộp móp hết cả"
⚠ SENTIMENT
⚠ Tổng thể: tiêu cực (0,72)
⚠ KEY PHRASE
⚠ "giao hàng", "đóng gói", "hộp móp"
| Tính năng | Trả lời |
|---|---|
| ⚠ Sentiment | ⚠ THÁI ĐỘ thế nào |
| ⚠ Key phrase | ⚠ NÓI VỀ cái gì |
Vì sao các phương án khác sai
-
C — ⚠ đảo ngược hai vế; ⚠ đây là bẫy chính của câu.
-
B (hai thuật ngữ như nhau) — ⚠ SAI.
-
A (không dùng trong NLP) — ⚠ SAI rõ ràng: ⚠ cả hai đều là tính năng lõi của AI Language.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ đây là ⚠ dạng "đảo vế" thứ ba trong đợt.
| Câu | Cặp khái niệm | Khoá |
|---|---|---|
| ⚠ #18025 | ⚠ face detection và face analysis | ⚠ D |
| ⚠ #18038 | ⚠ training và validation | ⚠ B |
| ⚠ #18059 | ⚠ object detection và recognition | ⚠ D |
| ⚠ #18061 (câu này) | ⚠ sentiment và key phrase | ⚠ D |
| ⚠ Khuôn chung | ⚠ một phương án đúng, một đảo vế, một nói "như nhau", một nói "không dùng" | |
| ⚠ Chiến thuật | ⚠ loại ngay hai phương án chối bỏ, rồi phân biệt cặp còn lại |
⚠ Bốn tính năng AI Language — trả lời bốn câu hỏi: | Tính năng | Câu hỏi | |---|---| | ⚠ Sentiment analysis | ⚠ cảm thấy thế nào | | ⚠ Key phrase extraction | ⚠ nói về cái gì | | ⚠ NER | ⚠ nhắc tới ai, nơi nào | | ⚠ Summarization | ⚠ rút gọn lại là gì |
Từ khoá nhận diện:
"tích cực hay tiêu cực" → ⚠ sentiment "chủ đề, ý chính" → ⚠ key phrase "tên riêng có phân loại" → ⚠ NER "tóm tắt" → ⚠ summarization
| ⚠ Dùng chung ba tính năng thế nào | Cách |
|---|---|
| ⚠ Key phrase: biết khách nói về CHỦ ĐỀ nào | |
| ⚠ Sentiment: biết họ khen hay chê | |
| ⚠ Ghép lại: CHỦ ĐỀ NÀO đang bị chê | ⚠ thông tin có giá trị nhất |
| ⚠ Thêm NER: chê SẢN PHẨM hay CHI NHÁNH nào | |
| ⚠ Một lượt gọi | ⚠ API cho phép chạy nhiều tác vụ trên cùng văn bản |
| ⚠ Vì sao câu vừa khen vừa chê khó | Lý do |
|---|---|
| ⚠ Cảm xúc tổng thể ra trung tính hoặc mixed | |
| ⚠ Mất thông tin về từng phần | |
| ⚠ Giải pháp | ⚠ opinion mining tách theo khía cạnh |
| ⚠ Hoặc | ⚠ chấm cảm xúc theo TỪNG CÂU thay vì cả tài liệu |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có đọc kỹ cả hai vế của phương án không | | | Cần biết thái độ hay biết chủ đề | | | Có ghép nhiều tính năng để ra thông tin hành động được không | |
Và chiến thuật xử lý dạng câu "khác biệt giữa A và B" nhanh và chắc nhất: loại ngay hai phương án nói "giống nhau" và "không liên quan", rồi chỉ cần phân biệt cặp còn lại — trong đó một cái chắc chắn bị đảo vế.
- A Generating realistic synthetic data for training models
- B Implementing recommendation systems based on user behavior
- C Conducting hypothesis testing in statistical analysis
- D Optimizing logistic operations through linear programming
Xem giải thích
Đáp án
A — Tạo DỮ LIỆU TỔNG HỢP chân thực để huấn luyện mô hình.
Vì sao đúng
⚠ Sinh dữ liệu tổng hợp là ứng dụng thực tế của AI sinh ngữ:
⚠ Dữ liệu thật
⚠ hiếm, đắt, hoặc NHẠY CẢM
↓ ⚠ mô hình sinh ngữ
⚠ Dữ liệu giả nhưng CÓ CÙNG ĐẶC TÍNH
↓
⚠ Dùng để huấn luyện mô hình khác
| Khi nào cần | Lý do |
|---|---|
| ⚠ Dữ liệu y tế, tài chính | ⚠ không chia sẻ được vì riêng tư |
| ⚠ Ca hiếm gặp | ⚠ lỗi sản xuất, gian lận |
| ⚠ Lớp thiểu số ít mẫu | ⚠ cân bằng dữ liệu |
| ⚠ Kiểm thử phần mềm | ⚠ cần dữ liệu giống thật |
Vì sao các phương án khác sai
-
B (hệ gợi ý dựa trên hành vi người dùng) — ⚠ học máy truyền thống hoặc học tăng cường.
-
C (kiểm định giả thuyết thống kê) — ⚠ thống kê cổ điển, không phải AI sinh ngữ.
-
D (tối ưu vận hành bằng quy hoạch tuyến tính) — ⚠ tối ưu hoá toán học, một lĩnh vực khác hẳn.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ đây là câu ⚠ thứ ba về generative AI trong đợt.
| Câu | Hỏi gì | Khoá |
|---|---|---|
| ⚠ #18036 | ⚠ đặc điểm mô hình sinh ngữ | ⚠ sinh dữ liệu mới tương tự tập đã học |
| ⚠ #18043 | ⚠ tính năng chính | ⚠ sinh văn bản giống người |
| ⚠ #18062 (câu này) | ⚠ kịch bản ứng dụng | ⚠ sinh dữ liệu tổng hợp |
| ⚠ Ba câu | ⚠ định nghĩa, tính năng, ứng dụng — không mâu thuẫn |
⚠ Ứng dụng generative AI trong doanh nghiệp: | Ứng dụng | Nội dung | |---|---| | ⚠ Trợ lý hỏi đáp trên tài liệu nội bộ | ⚠ RAG | | ⚠ Soạn thảo và viết lại nội dung | | | ⚠ Tóm tắt tài liệu, cuộc họp | | | ⚠ Sinh và giải thích mã nguồn | | | ⚠ Sinh dữ liệu tổng hợp | ⚠ đề này | | ⚠ Trích thông tin từ văn bản tự do | |
Từ khoá nhận diện:
"tạo dữ liệu giả để huấn luyện" → ⚠ generative AI "gợi ý theo hành vi" → ⚠ recommendation "tối ưu lộ trình, phân bổ nguồn lực" → ⚠ tối ưu hoá, không phải AI sinh ngữ "kiểm định giả thuyết" → ⚠ thống kê
| ⚠ Rủi ro của dữ liệu tổng hợp | Rủi ro |
|---|---|
| ⚠ Kế thừa thiên lệch của mô hình sinh | |
| ⚠ Có thể thiếu những ca biên hiếm nhất | ⚠ đúng thứ ta cần |
| ⚠ Mô hình học từ dữ liệu giả có thể lệch khỏi thực tế | |
| ⚠ Nên | ⚠ luôn kiểm chứng trên dữ liệu THẬT trước khi triển khai |
| ⚠ Dùng tốt nhất | ⚠ BỔ SUNG cho dữ liệu thật, không THAY THẾ |
| ⚠ Dữ liệu tổng hợp và quyền riêng tư | Điểm |
|---|---|
| ⚠ Giúp chia sẻ dữ liệu mà không lộ người thật | |
| ⚠ Nhưng KHÔNG tự động an toàn | |
| ⚠ Mô hình có thể vô tình tái tạo bản ghi thật | |
| ⚠ Cần | ⚠ kiểm tra xem có bản ghi nào trùng dữ liệu gốc không |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Dữ liệu tổng hợp có giữ được đặc tính của dữ liệu thật không | | | Đã kiểm trên dữ liệu thật chưa | | | Có bản ghi nào bị tái tạo nguyên văn không | |
Và giới hạn của dữ liệu tổng hợp mà người ta hay quên khi nó giải quyết được bài toán thiếu dữ liệu: nó chỉ tạo ra được những gì mô hình sinh đã biết. Chính những ca biên hiếm nhất — thứ bạn cần nhất — lại là thứ nó khó tạo ra nhất.
- A Building, training, and deploying machine learning models
- B Enhancing search capabilities within applications
- C Identifying irregularities in time-series data
- D Facilitating the creation of intelligent chatbots
Xem giải thích
Đáp án
C — Phát hiện các bất thường trong dữ liệu CHUỖI THỜI GIAN.
Vì sao đúng
⚠ Anomaly Detector là API chuyên cho một chuỗi số theo thời gian:
⚠ Chuỗi số theo thời gian
⚠ [100, 102, 98, 101, 350, 99, 103]
↓ ⚠ Anomaly Detector
⚠ Điểm thứ 5 là BẤT THƯỜNG
⚠ kèm giá trị kỳ vọng và biên trên dưới
| Hai chế độ | Nội dung |
|---|---|
| ⚠ Streaming | ⚠ kiểm điểm MỚI NHẤT ngay khi có |
| ⚠ Batch | ⚠ quét cả chuỗi lịch sử tìm điểm lạ |
| ⚠ Change point | ⚠ phát hiện chuyển đổi xu hướng |
| ⚠ Ưu điểm | ⚠ KHÔNG cần huấn luyện, gọi API là dùng |
Vì sao các phương án khác sai
-
A (xây, huấn luyện, triển khai mô hình) — ⚠ Azure Machine Learning.
-
B (tăng cường khả năng tìm kiếm) — ⚠ Azure AI Search.
-
D (dựng chatbot thông minh) — ⚠ Bot Service, Copilot Studio.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ dịch vụ này ⚠ cũng đã thông báo ngừng.
| Vấn đề | Thực tế |
|---|---|
| ⚠ Azure AI Anomaly Detector | ⚠ ngừng hoạt động tháng 10/2026 |
| ⚠ Ngừng nhận khách mới | ⚠ cùng đợt với Metrics Advisor và Personalizer |
| ⚠ Thay thế | ⚠ tự xây trên Azure ML, hoặc dùng Azure Monitor cho giám sát hạ tầng |
| ⚠ Giữ nguyên khoá | ⚠ C — KHÔNG sửa |
| ⚠ Đối chiếu | ⚠ #18053 (Personalizer), #18056 (Metrics Advisor) cùng đợt |
| ⚠ Nhận xét | ⚠ ba dịch vụ trong CÙNG một lô đề đều đã bị khai tử |
⚠ Ba câu về phát hiện bất thường trong đợt này: | Câu | Hỏi gì | Khoá | |---|---|---| | ⚠ #18007 | ⚠ anomaly detection làm gì | ⚠ tìm mẫu khác thường | | ⚠ #18056 | ⚠ Metrics Advisor làm gì | ⚠ giám sát chỉ số đa chiều | | ⚠ #18063 (câu này) | ⚠ Anomaly Detector làm gì | ⚠ bất thường trong chuỗi thời gian | | ⚠ Phân biệt | ⚠ Anomaly Detector = MỘT chuỗi; Metrics Advisor = NHIỀU chiều |
Từ khoá nhận diện:
"một chuỗi số theo thời gian" → ⚠ Anomaly Detector "nhiều chiều, phân tích nguyên nhân gốc" → ⚠ Metrics Advisor "giám sát máy chủ, log" → ⚠ Azure Monitor "ảnh sản phẩm lỗi" → ⚠ thị giác máy tính, không phải hai cái trên
| ⚠ Ba tham số chỉnh độ nhạy | Tham số |
|---|---|
| ⚠ Sensitivity | ⚠ cao thì bắt nhiều, báo nhầm nhiều |
| ⚠ Granularity | ⚠ phút, giờ, ngày — phải khớp dữ liệu |
| ⚠ maxAnomalyRatio | ⚠ tỉ lệ bất thường tối đa cho phép |
| ⚠ Chỉnh sai granularity | ⚠ kết quả vô nghĩa |
| ⚠ Điểm mạnh của API không cần huấn luyện | Điểm |
|---|---|
| ⚠ Không cần dữ liệu gán nhãn bất thường | |
| ⚠ Dùng được ngay trong ngày | |
| ⚠ Áp cho hàng nghìn chuỗi mà không cần mô hình riêng | |
| ⚠ Đánh đổi | ⚠ kém linh hoạt hơn mô hình tự xây cho ca đặc thù |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Dịch vụ trong đề còn được hỗ trợ không | | | Một chuỗi hay nhiều chiều | | | Granularity có khớp tần suất dữ liệu không | |
Và điều đáng chú ý nhất khi đọc lô câu hỏi này bằng con mắt của năm 2026: ba dịch vụ AI chuyên biệt xuất hiện trong cùng một lô đề đều đã bị khai tử. Kiến thức nền về bài toán thì vẫn nguyên giá trị; chỉ tên dịch vụ là thứ thay đổi nhanh.
- A Features are the output we want to predict, and labels are the input data used to make the prediction.
- B Features are the input data used to make a prediction, and labels are the output we want to predict.
- C Features and labels are both types of input data used to train the model.
- D Features and labels are both types of output data produced by the model.
Xem giải thích
Đáp án
B — Features là DỮ LIỆU ĐẦU VÀO dùng để dự đoán, còn labels là ĐẦU RA ta muốn dự đoán.
Vì sao đúng
⚠ Định nghĩa nền tảng, nêu đủ cả hai vế:
⚠ FEATURES (x) ⚠ LABEL (y)
⚠ diện tích ⚠ giá nhà
⚠ số phòng → ⚠ (thứ cần dự đoán)
⚠ vị trí
⚠ năm xây
⚠ ĐẦU VÀO ⚠ ĐẦU RA
Vì sao các phương án khác sai
-
A — ⚠ đảo ngược hai vế; ⚠ lại là bẫy đối xứng.
-
C (cả hai đều là dữ liệu ĐẦU VÀO) — ⚠ SAI: ⚠ nếu label cũng là đầu vào thì không còn gì để dự đoán.
-
D (cả hai đều là ĐẦU RA) — ⚠ SAI: ⚠ vậy mô hình lấy gì làm căn cứ.
Ghi nhớ
⚠ Ghi nhớ về chất lượng câu hỏi: ⚠ câu này ⚠ gần trùng #18005 ở đợt trước, ⚠ nhưng ⚠ soạn TỐT HƠN.
| Câu | Vấn đề |
|---|---|
| ⚠ #18005 | ⚠ có HAI phương án cùng đúng — C và D là hai vế rời của cùng định nghĩa |
| ⚠ #18064 (câu này) | ⚠ mỗi phương án nêu ĐỦ CẢ HAI vế nên chỉ có một đáp án đúng |
| ⚠ Bài học soạn đề | ⚠ nêu đủ cả hai vế trong mỗi phương án là cách tránh mơ hồ |
| ⚠ Với người học | ⚠ hai câu cùng kiểm tra một kiến thức, khoá không mâu thuẫn |
⚠ Từ vựng nền tảng — bảng phải thuộc: | Từ | Nghĩa | |---|---| | ⚠ Feature | ⚠ cột đầu vào | | ⚠ Label / Target | ⚠ cột cần dự đoán | | ⚠ Observation | ⚠ một dòng dữ liệu | | ⚠ Training data | ⚠ có cả feature và label | | ⚠ Dữ liệu dự đoán | ⚠ CHỈ có feature |
Từ khoá nhận diện:
"đầu vào, thông tin đã biết" → ⚠ feature "đầu ra, thứ cần biết" → ⚠ label "cột nào là kết quả" → ⚠ label column trong AutoML "không có nhãn" → ⚠ học không giám sát
| ⚠ Rò rỉ đáp án — lỗi chết người | Ví dụ |
|---|---|
| ⚠ Dự đoán khách có huỷ hợp đồng không | |
| ⚠ Mà đưa cột "ngày huỷ hợp đồng" vào feature | |
| ⚠ Mô hình đạt gần 100% trên giấy | |
| ⚠ Ra thực tế VÔ DỤNG | ⚠ lúc dự đoán chưa có cột đó |
| ⚠ Cách kiểm | ⚠ hỏi: tại THỜI ĐIỂM dự đoán, ta đã có cột này chưa |
| ⚠ Feature engineering — nơi tạo khác biệt | Việc |
|---|---|
| ⚠ Từ ngày sinh tính ra tuổi | |
| ⚠ Từ ngày giao dịch ra thứ trong tuần | |
| ⚠ Gộp hai cột thành tỉ lệ có nghĩa | |
| ⚠ Nhóm giá trị hiếm lại thành "khác" | |
| ⚠ Thực tế | ⚠ đặc trưng tốt thường cải thiện nhiều hơn đổi thuật toán |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Cột nào là label | | | Tại thời điểm dự đoán, mọi feature đã có sẵn chưa | ⚠ câu hỏi chống rò rỉ | | Có đặc trưng nào tạo thêm được từ dữ liệu hiện có không | |
Và câu hỏi duy nhất cần đặt cho từng cột trước khi đưa vào mô hình, đủ để chặn gần hết lỗi rò rỉ dữ liệu: "vào đúng thời điểm cần dự đoán, tôi đã có giá trị của cột này chưa?" Nếu chưa, nó không phải feature.