Ngân hàng đề — Google Cloud Generative AI Leader
Tìm thấy 556 câu.
*Which of the following is an example of unstructured data?
-
A
A. A database of product IDs, prices, and inventory levels.
-
B
B. A spreadsheet with customer names, addresses, and purchase history.
-
C
C. A collection of customer reviews in the form of free-text paragraphs.
-
D
D. A table of employee names, salaries, and job titles.
Xem giải thích
Đáp án
C — Một tập hợp đánh giá của khách hàng dưới dạng các đoạn văn bản tự do.
Vì sao đúng
Dữ liệu phi cấu trúc là dữ liệu không có mô hình dữ liệu định sẵn — không chia được thành hàng và cột có ý nghĩa cố định.
⚠ Vì sao văn bản tự do là phi cấu trúc:
⚠ Mỗi đánh giá dài ngắn khác nhau
⚠ Không có trường cố định
⚠ Ý nghĩa nằm trong NGÔN NGỮ,
không nằm trong ô
↓
⚠ Máy phải HIỂU mới khai thác được
Vì sao các phương án khác sai
Cả ba đều là dữ liệu có cấu trúc — bảng với trường xác định:
- A (CSDL mã sản phẩm, giá, mức tồn kho) — ⚠ bảng, mỗi cột một kiểu dữ liệu.
- B (bảng tính tên khách, địa chỉ, lịch sử mua) — ⚠ bẫy nhẹ: "địa chỉ" nghe như văn bản, nhưng nó nằm trong cột xác định của bảng tính → vẫn là có cấu trúc.
- D (bảng tên nhân viên, lương, chức danh) — ⚠ bảng rõ ràng.
Ghi nhớ
⚠ Ba mức cấu trúc — bảng phải thuộc: | Mức | Đặc điểm | Ví dụ | |---|---|---| | Có cấu trúc | ⚠ hàng, cột, kiểu cố định | ⚠ CSDL, bảng tính | | Bán cấu trúc | ⚠ có thẻ nhưng linh hoạt | ⚠ JSON, XML, email có tiêu đề | | ⚠ Phi cấu trúc | ⚠ không có mô hình định sẵn | ⚠ văn bản tự do, ảnh, video, âm thanh — đề này |
Từ khoá nhận diện:
"văn bản tự do, đoạn văn, đánh giá, ghi chú" → ⚠ phi cấu trúc "bảng, cột, CSDL, bảng tính" → ⚠ có cấu trúc "JSON, XML, log" → ⚠ bán cấu trúc "ảnh, video, âm thanh" → ⚠ phi cấu trúc
| ⚠ Vì sao phi cấu trúc quan trọng với gen AI | Lý do |
|---|---|
| ⚠ Chiếm khoảng 80% dữ liệu doanh nghiệp | |
| ⚠ Trước đây rất khó khai thác | ⚠ phải gán nhãn thủ công |
| ⚠ LLM đọc hiểu được TRỰC TIẾP | |
| Kết quả | ⚠ kho tài liệu, email, log chat từ gánh nặng thành tài sản |
| ⚠ Bẫy hay gặp | Bẫy |
|---|---|
| ⚠ Nhầm "có chữ" với "phi cấu trúc" | ⚠ địa chỉ trong cột vẫn là có cấu trúc |
| ⚠ Nhầm "phi cấu trúc" với "không nhãn" | ⚠ HAI TRỤC KHÁC NHAU |
| Nhầm "bán cấu trúc" với "có cấu trúc" | ⚠ JSON linh hoạt hơn bảng |
| ⚠ Xử lý dữ liệu phi cấu trúc | Cách |
|---|---|
| ⚠ Lưu ở Cloud Storage | ⚠ object storage |
| ⚠ Trích thông tin bằng LLM hoặc API chuyên | |
| ⚠ Lập chỉ mục vector cho RAG | |
| Sinh siêu dữ liệu để tìm kiếm | |
| ⚠ Cẩn thận PII lẫn trong văn bản |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Dữ liệu này có mô hình cố định không | ⚠ có thì là có cấu trúc | | Có PII lẫn trong văn bản tự do không | ⚠ quét trước khi dùng | | Đang lưu ở đâu | ⚠ phi cấu trúc thì dùng object storage |
Và điều đáng nhớ nhất: "có chữ" không đồng nghĩa với "phi cấu trúc". Cái quyết định là có mô hình dữ liệu định sẵn hay không — một ô địa chỉ trong bảng tính vẫn nằm trong cấu trúc, còn một đoạn nhận xét dài thì không.
*Arrange the ML lifecycle steps in the right order.
-
A
A. Data ingestion and preparation > Model training > Model deployment > Model management
-
B
B. Data ingestion and preparation > Model training > Model management > Model deployment
-
C
C. Model training > Model deployment > Model management > Data ingestion and preparation
-
D
D. Model training > Data ingestion and preparation > Model deployment > Model management
Xem giải thích
Đáp án
A — Nạp và chuẩn bị dữ liệu → Huấn luyện mô hình → Triển khai mô hình → Quản lý mô hình.
Vì sao đúng
Thứ tự này theo đúng logic nhân quả: phải có dữ liệu mới huấn luyện được, phải có mô hình mới triển khai được, phải triển khai rồi mới quản lý được.
⚠ Bốn bước và lý do thứ tự:
⚠ 1. NẠP VÀ CHUẨN BỊ DỮ LIỆU
→ ⚠ không có dữ liệu thì không
huấn luyện được gì
⚠ 2. HUẤN LUYỆN
→ ⚠ mô hình học từ dữ liệu đã sạch
⚠ 3. TRIỂN KHAI
→ ⚠ đưa mô hình ra phục vụ thật
⚠ 4. QUẢN LÝ
→ ⚠ giám sát, phiên bản, huấn luyện lại
→ ⚠ chỉ có ý nghĩa SAU khi đã chạy
Vì sao các phương án khác sai
-
B (…triển khai và quản lý ĐẢO CHỖ) — ⚠ bẫy gần nhất: quản lý mô hình bao gồm giám sát hiệu năng trong sản xuất, nên ⚠ không thể đứng trước triển khai.
-
C và D (đặt huấn luyện TRƯỚC nạp dữ liệu) — ⚠ vô lý về nhân quả: không có dữ liệu thì huấn luyện bằng gì.
⚠ Mẹo chấm câu sắp thứ tự: tìm cặp nào chắc chắn nhất rồi loại. Ở đây "dữ liệu phải trước huấn luyện" loại ngay C và D.
Ghi nhớ
⚠ Vòng đời ML đầy đủ — bảng phải thuộc: | Bước | Việc | |---|---| | ⚠ 1. Nạp và chuẩn bị dữ liệu | ⚠ thu thập, làm sạch, biến đổi | | ⚠ 2. Huấn luyện | ⚠ mô hình học, tinh chỉnh tham số | | Đánh giá | ⚠ đo chất lượng trước khi phát hành | | ⚠ 3. Triển khai | ⚠ endpoint, phục vụ | | ⚠ 4. Quản lý | ⚠ giám sát, phiên bản, huấn luyện lại |
Từ khoá nhận diện:
"thu thập, làm sạch" → ⚠ bước 1 "mô hình học" → ⚠ bước 2 "đưa ra phục vụ" → ⚠ bước 3 "giám sát, trôi dạt, phiên bản" → ⚠ bước 4
| ⚠ Vì sao đây là VÒNG chứ không phải đường thẳng | Lý do |
|---|---|
| ⚠ Giám sát phát hiện suy giảm | |
| ⚠ Quay lại thu thập dữ liệu mới | |
| ⚠ Huấn luyện lại, triển khai lại | |
| Kết luận | ⚠ mô hình KHÔNG phải triển khai một lần rồi thôi |
| ⚠ Công cụ Vertex AI theo bước | Công cụ |
|---|---|
| Bước 1 | ⚠ Cloud Storage, BigQuery, Feature Store |
| Bước 2 | ⚠ Workbench, Vizier, Training |
| Bước 3 | ⚠ Prediction, Endpoints |
| Bước 4 | ⚠ Model Registry, Model Monitoring |
| Xuyên suốt | ⚠ Pipelines tự động hoá cả chuỗi |
| ⚠ Bước nào tốn nhiều thời gian nhất | Bước |
|---|---|
| ⚠ Bước 1 — chuẩn bị dữ liệu | ⚠ thường 60–80% công sức |
| ⚠ Đội mới hay đánh giá thấp bước này | |
| Huấn luyện thường nhanh hơn tưởng | |
| ⚠ Quản lý bị bỏ quên nhiều nhất | ⚠ và gây sự cố nhiều nhất về dài hạn |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có bước giám sát sau triển khai chưa | ⚠ nhiều đội dừng ở bước 3 | | Quy trình có tự động hoá được không | ⚠ Pipelines | | Chạy lại có ra kết quả cũ không | ⚠ tính tái hiện |
Và dấu hiệu phân biệt đội ML trưởng thành: họ có bước 4. Rất nhiều dự án dừng lại ngay sau khi triển khai, rồi mô hình âm thầm xuống cấp mà không ai biết.
What is a model in the context of machine learning?
-
A
A. A visual representation of data.
-
B
B. A type of computer hardware.
-
C
C. A complex mathematical structure that processes inputs to generate outputs.
-
D
D. A set of pre-defined rules for decision-making.
Xem giải thích
Đáp án
C — Một cấu trúc toán học phức tạp xử lý đầu vào để sinh ra đầu ra.
Vì sao đúng
Về bản chất kỹ thuật, một mô hình machine learning là một hàm toán học có hàng triệu tới hàng tỷ tham số, nhận đầu vào và cho ra đầu ra.
⚠ Bản chất:
⚠ Đầu vào (dữ liệu)
↓
⚠ Cấu trúc toán học
→ ⚠ các phép nhân ma trận
→ ⚠ hàm kích hoạt
→ ⚠ hàng tỷ TRỌNG SỐ đã học
↓
⚠ Đầu ra (dự đoán / nội dung)
⚠ "Đã học" nghĩa là gì:
⚠ Trọng số ban đầu là ngẫu nhiên
⚠ Huấn luyện = ĐIỀU CHỈNH trọng số
để giảm sai số
↓
⚠ Mô hình cuối cùng CHÍNH LÀ
bộ trọng số đó
Vì sao các phương án khác sai
-
D (một tập LUẬT định sẵn để ra quyết định) — ⚠ bẫy mạnh nhất: đó là hệ chuyên gia dựa luật, thế hệ AI cũ. ⚠ Điểm khác biệt cốt lõi: mô hình ML HỌC từ dữ liệu, không được người viết luật cho.
-
B (một loại phần cứng máy tính) — ⚠ nhầm tầng: phần cứng là GPU/TPU.
-
A (một biểu diễn trực quan của dữ liệu) — ⚠ đó là biểu đồ, không phải mô hình.
Ghi nhớ
⚠ Bốn khái niệm hay bị nhầm — bảng phải thuộc: | Khái niệm | Là gì | |---|---| | ⚠ Mô hình ML | ⚠ cấu trúc toán học có trọng số ĐÃ HỌC — đề này | | Hệ dựa luật | ⚠ luật do NGƯỜI viết | | Phần cứng | ⚠ GPU, TPU | | Trực quan hoá | ⚠ biểu đồ, dashboard |
Từ khoá nhận diện:
"cấu trúc toán học, xử lý đầu vào ra đầu ra" → ⚠ mô hình "luật định sẵn, if-then" → ⚠ hệ chuyên gia "chip, máy chủ" → ⚠ phần cứng "biểu đồ" → ⚠ trực quan hoá
| ⚠ ML khác lập trình truyền thống | Khác |
|---|---|
| Lập trình truyền thống | ⚠ người viết LUẬT → máy áp dụng |
| ⚠ Machine learning | ⚠ người đưa VÍ DỤ → máy tự tìm luật |
| Hệ quả | ⚠ giải được bài toán không viết luật nổi |
| ⚠ Cái giá | ⚠ không giải thích được rõ như luật |
| ⚠ "Mô hình" trong thực tế gồm gì | Gồm |
|---|---|
| ⚠ Kiến trúc | ⚠ hình dạng mạng, số lớp |
| ⚠ Trọng số | ⚠ phần được HỌC |
| Cấu hình tiền xử lý | ⚠ đầu vào phải chuẩn hoá giống lúc huấn luyện |
| ⚠ Siêu dữ liệu | ⚠ dữ liệu huấn luyện, chỉ số, phiên bản |
| Lưu ở | ⚠ Model Registry |
| ⚠ Hiểu lầm phổ biến | Hiểu lầm |
|---|---|
| ⚠ "Mô hình lưu bản sao dữ liệu huấn luyện" | ⚠ không — nó lưu mẫu hình |
| ⚠ "Mô hình tra cứu để trả lời" | ⚠ không — nó tính toán |
| ⚠ "Mô hình học thêm khi tôi dùng" | ⚠ không, trừ khi được huấn luyện lại |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Bài toán này viết luật được không | ⚠ được thì hệ luật đơn giản và rẻ hơn | | Có cần giải thích quyết định không | ⚠ mô hình lớn là hộp đen | | Đang chạy phiên bản trọng số nào | ⚠ phải trả lời được |
Và cách hiểu bản chất dễ nhớ nhất: mô hình là một hàm số khổng lồ mà không ai viết ra bằng tay — nó được tìm ra bằng cách cho máy xem thật nhiều ví dụ. Đó vừa là sức mạnh vừa là lý do nó khó giải thích.
How does consistency impact AI model training?
-
A
A. It reduces the need for data storage.
-
B
B. It increases the speed of data retrieval.
-
C
C. It ensures data is relevant to the task.
-
D
D. Inconsistent formats and labeling can confuse the model and hinder learning.
Xem giải thích
Đáp án
D — Định dạng và cách gán nhãn không nhất quán có thể làm mô hình bị nhiễu và cản trở việc học.
Vì sao đúng
Mô hình học bằng cách tìm mẫu hình trong dữ liệu. Nếu cùng một thứ được biểu diễn theo nhiều cách, mô hình không nhận ra chúng là một.
⚠ Hai loại thiếu nhất quán:
⚠ ĐỊNH DẠNG không nhất quán
→ ngày: 01/02/2026 vs 2026-02-01
→ tiền: 1000 vs 1.000 vs 1,000
→ đơn vị: kg vs gram
⚠ NHÃN không nhất quán
→ "Electronics" vs "ELEC" vs
"electroniks"
↓
⚠ Mô hình coi là các giá trị KHÁC NHAU
⚠ Dữ liệu mỗi nhóm bị chia nhỏ
⚠ Mẫu hình bị loãng → học kém
⚠ Gần trùng với #14218 (lô 152) và #14150 (lô 150) — cùng đặc tính consistency, ba biểu hiện khác nhau: câu này nói về tác động lên huấn luyện, #14218 về chuẩn hoá giá trị, #14150 về hai hệ thống dùng mã khác nhau.
Vì sao các phương án khác sai
- C (đảm bảo dữ liệu liên quan tới nhiệm vụ) — ⚠ đó là relevance, một đặc tính khác.
- A (giảm nhu cầu lưu trữ) — ⚠ không liên quan; nhất quán không làm dữ liệu nhỏ đi đáng kể.
- B (tăng tốc độ truy xuất dữ liệu) — ⚠ vấn đề hiệu năng, không phải chất lượng học.
Ghi nhớ
⚠ Sáu đặc tính chất lượng dữ liệu — bảng phải thuộc: | Đặc tính | Ảnh hưởng khi thiếu | |---|---| | ⚠ Consistency | ⚠ mô hình nhiễu, học kém — đề này | | Accuracy | ⚠ mô hình học sai | | Completeness | ⚠ bất công với nhóm thiếu dữ liệu | | Timeliness | ⚠ quyết định theo thực tế cũ | | Relevance | ⚠ nhiễu, mô hình kém | | Availability | ⚠ không dùng được |
Từ khoá nhận diện:
"định dạng khác nhau, nhãn lộn xộn" → ⚠ consistency "ô trống" → completeness "sai so với thực tế" → accuracy "không phục vụ mục đích" → relevance
| ⚠ Nguồn gây thiếu nhất quán | Nguồn |
|---|---|
| ⚠ Nhập tay tự do | ⚠ số một |
| ⚠ Nhiều hệ thống, nhiều quy ước | |
| ⚠ Sáp nhập dữ liệu | |
| Đổi quy ước theo thời gian | |
| ⚠ Đa vùng, đa ngôn ngữ | ⚠ định dạng ngày, dấu thập phân |
| ⚠ Cách chuẩn hoá | Cách |
|---|---|
| ⚠ Danh sách chọn thay vì nhập tự do | ⚠ chặn từ gốc |
| ⚠ Bảng ánh xạ giá trị chuẩn | |
| ⚠ Chuẩn hoá lúc nạp dữ liệu | |
| Khớp gần đúng bắt lỗi chính tả | |
| ⚠ Kiểm tra tự động phát hiện giá trị lạ |
| ⚠ Nhãn không nhất quán còn gây gì | Gây |
|---|---|
| ⚠ Mô hình học mâu thuẫn | ⚠ cùng dữ liệu, hai nhãn khác nhau |
| ⚠ Đánh giá sai lệch | ⚠ tập test cũng bẩn |
| Báo cáo nghiệp vụ sai | ⚠ doanh thu theo ngành bị chia nhỏ |
| Cách phát hiện | ⚠ cho hai người gán cùng 50 mẫu rồi đo đồng thuận |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đếm số giá trị duy nhất mỗi trường phân loại | ⚠ nhiều bất thường là dấu hiệu ngay | | Có danh sách giá trị chuẩn chưa | | | Người gán nhãn có hướng dẫn thống nhất chưa | |
Và cách phát hiện nhanh nhất trong bất kỳ tập dữ liệu nào: đếm số giá trị duy nhất của mỗi trường phân loại. Một trường lẽ ra có 12 giá trị mà đếm ra 47 thì gần như chắc chắn đang có vấn đề nhất quán.
What is the primary way that agents learn in reinforcement learning?
-
A
A. By observing and imitating expert demonstrations.
-
B
B. By analyzing large datasets of labeled examples.
-
C
C. By being explicitly programmed with the correct actions.
-
D
D. By interacting with their environment and receiving feedback.
Xem giải thích
Đáp án
D — Bằng cách tương tác với môi trường của chúng và nhận phản hồi.
Vì sao đúng
Đây là định nghĩa của học tăng cường: tác nhân hành động, môi trường phản hồi, tác nhân điều chỉnh.
⚠ Vòng lặp RL:
⚠ Tác nhân quan sát TRẠNG THÁI
↓
⚠ Chọn HÀNH ĐỘNG
↓
⚠ Môi trường trả PHẦN THƯỞNG
và trạng thái mới
↓
⚠ Tác nhân điều chỉnh chiến lược
↓
⚠ Lặp lại rất nhiều lần
⚠ Trùng ý với #14207 (lô 152) và #14194 (lô 151) — ba câu cùng về học tăng cường, cùng hướng khoá. Bộ đề nhấn mạnh chủ đề này rất nhiều lần.
Vì sao các phương án khác sai
-
B (phân tích tập dữ liệu lớn gồm ví dụ ĐÃ GÁN NHÃN) — ⚠ đó là supervised learning.
-
A (quan sát và bắt chước màn trình diễn của chuyên gia) — ⚠ bẫy tinh vi nhất: đó là imitation learning / học từ minh hoạ, một kỹ thuật khác và có thật. ⚠ Nó không có tín hiệu thưởng — tác nhân chỉ sao chép, không tự khám phá.
-
C (được lập trình tường minh các hành động đúng) — ⚠ đó là lập trình theo luật, không phải học.
Ghi nhớ
⚠ Bốn cách một tác nhân có được hành vi — bảng phải thuộc: | Cách | Cơ chế | |---|---| | ⚠ Reinforcement learning | ⚠ thử và sai + thưởng phạt — đề này | | Imitation learning | ⚠ bắt chước chuyên gia | | Supervised learning | ⚠ học từ nhãn đúng | | Lập trình theo luật | ⚠ người viết sẵn |
Từ khoá nhận diện:
"tương tác, phản hồi, thưởng phạt" → ⚠ reinforcement "bắt chước chuyên gia" → ⚠ imitation learning "nhãn đúng có sẵn" → supervised "lập trình tường minh" → hệ luật
| ⚠ RL khác imitation learning ở đâu | Khác |
|---|---|
| ⚠ RL: TỰ khám phá bằng thử sai | ⚠ có thể vượt chuyên gia |
| ⚠ Imitation: sao chép chuyên gia | ⚠ giỏi nhất bằng chuyên gia |
| ⚠ RL cần hàm thưởng | |
| Imitation cần dữ liệu minh hoạ | |
| Thực tế | ⚠ hay kết hợp: bắt chước trước, RL tinh chỉnh sau |
| ⚠ Bốn thành phần bài toán RL | Thành phần |
|---|---|
| ⚠ Tác nhân | |
| ⚠ Môi trường | |
| ⚠ Hành động | |
| ⚠ Phần thưởng | ⚠ thiết kế sai là hỏng tất cả |
| Mục tiêu | ⚠ tối đa tổng thưởng DÀI HẠN |
| ⚠ RLHF — ứng dụng quen thuộc nhất | RLHF |
|---|---|
| ⚠ Con người xếp hạng các câu trả lời | |
| ⚠ Xếp hạng đó thành tín hiệu thưởng | |
| ⚠ Mô hình học tạo câu trả lời được ưa hơn | |
| Đây là cách | ⚠ LLM được căn chỉnh cho hữu ích và an toàn |
| ⚠ Rủi ro | ⚠ mang định kiến của người đánh giá vào mô hình |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có định nghĩa được phần thưởng không | ⚠ không thì RL không áp dụng được | | Hàm thưởng có kẽ hở nào không | ⚠ quan sát hành vi, đừng chỉ nhìn điểm | | Thử sai ở đâu | ⚠ mô phỏng trước, đời thật sau |
Và bài học quan trọng nhất của RL, đúng cho mọi hệ thống tối ưu: hệ thống sẽ tối ưu đúng thứ bạn thưởng, không phải thứ bạn muốn. Định nghĩa phần thưởng sai là cách nhanh nhất để có một tác nhân đạt điểm rất cao mà làm hỏng việc.
*What is the primary purpose of the data ingestion and preparation stage in the ML workflow?
-
A
A. Collecting, cleaning, and transforming raw data.
-
B
B. Deploying trained models.
-
C
C. Monitoring model performance.
-
D
D. Training machine learning models.
Xem giải thích
Đáp án
A — Thu thập, làm sạch và biến đổi dữ liệu thô.
Vì sao đúng
Đây là định nghĩa nguyên văn của giai đoạn data ingestion and preparation trong quy trình ML.
⚠ Ba việc trong một bước:
⚠ THU THẬP (ingestion)
→ ⚠ lấy dữ liệu từ nhiều nguồn
⚠ LÀM SẠCH (cleaning)
→ ⚠ giá trị thiếu, bản ghi trùng,
giá trị bất thường
⚠ BIẾN ĐỔI (transformation)
→ ⚠ chuẩn hoá, mã hoá, tạo đặc trưng
⚠ Gần trùng với #14217 (lô 152) — câu kia hỏi giai đoạn nào làm ba việc đó, câu này hỏi mục đích của giai đoạn. Cùng kiến thức.
Vì sao các phương án khác sai
Cả ba đều là giai đoạn KHÁC:
- D (huấn luyện mô hình) — ⚠ bước sau, dùng dữ liệu đã chuẩn bị xong.
- B (triển khai mô hình đã huấn luyện) — ⚠ bước gần cuối.
- C (giám sát hiệu năng mô hình) — ⚠ bước sau triển khai.
Ghi nhớ
⚠ Vòng đời ML — bảng phải thuộc: | Bước | Việc | |---|---| | ⚠ 1. Nạp và chuẩn bị dữ liệu | ⚠ thu thập, làm sạch, biến đổi — đề này | | 2. Huấn luyện | | | 3. Đánh giá | | | 4. Triển khai | | | 5. Giám sát và quản lý | |
Từ khoá nhận diện:
"thu thập, làm sạch, biến đổi, ETL" → ⚠ chuẩn bị dữ liệu "mô hình học" → huấn luyện "endpoint, phục vụ" → triển khai "trôi dạt, suy giảm" → giám sát
| ⚠ Vì sao bước này tốn nhiều thời gian nhất | Lý do |
|---|---|
| ⚠ Thường 60–80% công sức dự án | |
| ⚠ Dữ liệu thực tế luôn bẩn | |
| ⚠ Dữ liệu ở nhiều hệ thống, nhiều quy ước | |
| Cần hiểu nghiệp vụ mới làm sạch đúng | |
| Câu kinh điển | ⚠ "rác vào, rác ra" |
| ⚠ Việc cụ thể phải làm | Việc |
|---|---|
| ⚠ Xử lý giá trị thiếu | ⚠ bỏ, điền, hay đánh dấu |
| ⚠ Loại bản ghi trùng | |
| ⚠ Chuẩn hoá định dạng và đơn vị | |
| ⚠ Mã hoá biến phân loại | |
| Tạo đặc trưng mới | |
| ⚠ Chia tập train/validation/test | ⚠ chia TRƯỚC khi biến đổi |
| ⚠ Bẫy rò rỉ dữ liệu | Bẫy |
|---|---|
| ⚠ Tính thống kê chuẩn hoá trên TOÀN BỘ rồi mới chia | ⚠ thông tin tập test lọt vào |
| ⚠ Dùng đặc trưng chỉ có SAU khi biết kết quả | ⚠ mô hình đẹp trên giấy, vô dụng thật |
| Cách tránh | ⚠ chia tập trước, biến đổi sau |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Có đặc trưng nào chứa thông tin tương lai không | ⚠ lỗi khó phát hiện nhất | | Tỷ lệ giá trị thiếu bao nhiêu | | | Chia tập trước hay sau khi biến đổi | ⚠ phải là trước |
Và điều mọi người làm ML học được sau vài dự án: phần lớn thời gian dành cho dữ liệu, không dành cho mô hình. Đội nào lập kế hoạch ngược lại thường vỡ tiến độ ngay từ tuần thứ hai.
*Which type of foundation model would be MOST suitable for generating photorealistic images from textual descriptions?
-
A
A. Large language model (LLM)
-
B
B. Classification model
-
C
C. Diffusion model
-
D
D. Multimodal model
Xem giải thích
Đáp án
C — Diffusion model (mô hình khuếch tán).
Vì sao đúng
Sinh ảnh chân thực từ mô tả bằng chữ là việc của mô hình khuếch tán — kiến trúc đứng sau Imagen và hầu hết công cụ sinh ảnh hiện nay.
⚠ Cách hoạt động:
⚠ Bắt đầu từ NHIỄU ngẫu nhiên
↓ ⚠ khử nhiễu từng bước
↓ ⚠ prompt dẫn đường
⚠ Ảnh hoàn chỉnh
Ghi nhớ về chất lượng câu hỏi
⚠ Câu này TRÙNG ĐỀ BÀI với #14155 (lô 151) — cùng câu hỏi, cùng bốn phương án.
⚠ Đáp án vẫn ở chữ C, nhưng ⚠ ba phương án sai đã xáo lại thứ tự (LLM và Multimodal đổi chỗ). ⚠ Trùng vị trí là ngẫu nhiên — lô 152 đã có năm câu đổi chữ cái.
Vì sao các phương án khác sai
-
D (Multimodal model) — ⚠ bẫy mạnh nhất: "đa phương thức" nói về loại DỮ LIỆU xử lý được, không nói về kiến trúc sinh ảnh. ⚠ Nhiều mô hình đa phương thức chỉ hiểu ảnh chứ không tạo ảnh.
-
A (LLM) — ⚠ sinh văn bản.
-
B (Classification model) — ⚠ phân loại, cho ra nhãn chứ không tạo gì mới.
Ghi nhớ
⚠ Kiến trúc theo đầu ra — bảng phải thuộc: | Kiến trúc | Sinh ra | |---|---| | ⚠ Diffusion | ⚠ ẢNH, video — đề này | | Transformer / LLM | ⚠ văn bản, mã | | GAN | ⚠ ảnh — thế hệ cũ hơn | | Classification | ⚠ nhãn, KHÔNG sinh gì |
Từ khoá nhận diện:
"từ nhiễu, sinh ảnh chân thực" → ⚠ Diffusion "nhiều loại đầu vào" → ⚠ multimodal — nói về DỮ LIỆU, không phải kiến trúc "sinh văn bản" → LLM "gán nhãn" → classification
| ⚠ Diffusion hoạt động thế nào | Bước |
|---|---|
| ⚠ Huấn luyện: thêm nhiễu dần vào ảnh thật | ⚠ mô hình học cách nhiễu được thêm |
| ⚠ Sinh ảnh: đi ngược, khử nhiễu dần | |
| ⚠ Prompt dẫn hướng quá trình khử nhiễu | |
| Ví von | ⚠ nhà điêu khắc gọt từ khối đá thô |
| ⚠ Vì sao diffusion thắng GAN | Lý do |
|---|---|
| ⚠ Huấn luyện ổn định hơn | ⚠ GAN hay sụp chế độ |
| ⚠ Đa dạng đầu ra tốt hơn | |
| ⚠ Chất lượng cao ở độ phân giải lớn | |
| Đánh đổi | ⚠ chậm hơn — phải khử nhiễu nhiều bước |
| ⚠ Sản phẩm Google theo kiến trúc | Sản phẩm |
|---|---|
| ⚠ Imagen | ⚠ ảnh — diffusion |
| ⚠ Veo | ⚠ video |
| Gemini | ⚠ nền Transformer, đa phương thức đầu vào |
| Chirp / Lyria | ⚠ giọng nói / âm nhạc |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đầu ra cần là gì | ⚠ quyết định kiến trúc | | Ảnh có dấu SynthID không | ⚠ minh bạch nguồn gốc | | Có vi phạm bản quyền hay chân dung không | ⚠ kiểm trước khi dùng thương mại |
Và mẹo phân biệt bền vững: "multimodal" trả lời mô hình ĐỌC ĐƯỢC gì, "diffusion" trả lời nó TẠO ra ảnh BẰNG CÁCH NÀO. Đề hỏi cách tạo ảnh thì phải chọn kiến trúc.
*What is the primary role of humans in the loop (HITL) in machine learning?
-
A
A. To integrate human expertise into the ML process, especially for tasks requiring judgment or context.
-
B
B. To automate all decision-making processes.
-
C
C. To eliminate the need for data collection and model training.
-
D
D. To replace AI algorithms entirely.
Xem giải thích
Đáp án
A — Đưa chuyên môn con người vào quy trình ML, đặc biệt cho những việc đòi hỏi phán đoán hoặc hiểu ngữ cảnh.
Vì sao đúng
HITL không phải thay thế AI cũng không phải bỏ AI, mà là kết hợp — máy làm phần máy giỏi, người làm phần người giỏi.
⚠ Chỗ nào cần con người:
⚠ Ca biên, ca mơ hồ
⚠ Quyết định rủi ro cao
⚠ Ngữ cảnh mô hình không có
⚠ Phán đoán đạo đức
⚠ Gán nhãn dữ liệu
⚠ Đánh giá chất lượng đầu ra
Ghi nhớ về chất lượng câu hỏi
⚠ Câu này TRÙNG ĐỀ BÀI với #14166 (lô 151) — cùng câu hỏi, cùng bốn phương án.
⚠ Bộ đề ĐÃ ĐỔI CHỮ CÁI:
| Lô | Vị trí đáp án |
|---|---|
| #14166 (lô 151) | ⚠ chữ B |
| #14263 (lô này) | ⚠ chữ A |
⚠ Sau năm câu đổi chữ cái ở lô 152, đây là câu tiếp theo. ⚠ Đây là quy luật vận hành của bộ đề, không phải ngoại lệ.
Vì sao các phương án khác sai
- B (tự động hoá TOÀN BỘ việc ra quyết định) — ⚠ ngược hẳn: đó là bỏ người ra khỏi vòng lặp.
- D (thay thế hoàn toàn thuật toán AI) — ⚠ HITL là bổ sung, không thay thế.
- C (loại bỏ nhu cầu thu thập dữ liệu và huấn luyện) — ⚠ sai: có HITL vẫn phải làm hai việc đó.
Ghi nhớ
⚠ Ba mức tự chủ — bảng phải thuộc: | Mức | Vai trò con người | |---|---| | ⚠ Human-in-the-loop | ⚠ duyệt TỪNG quyết định — đề này | | Human-on-the-loop | ⚠ giám sát, can thiệp khi cần | | Human-out-of-the-loop | ⚠ hoàn toàn tự động | | ⚠ Chọn theo | ⚠ mức rủi ro của quyết định |
Từ khoá nhận diện:
"phán đoán, ngữ cảnh, rủi ro cao" → ⚠ HITL "tự động hoàn toàn" → ⚠ không phải HITL "gán nhãn, đánh giá, phản hồi" → ⚠ cũng là HITL
| ⚠ Khi nào HITL là BẮT BUỘC | Khi nào |
|---|---|
| ⚠ Ảnh hưởng sinh kế, sức khoẻ, tự do | ⚠ tuyển dụng, cho vay, y tế |
| ⚠ Hành động không hoàn tác được | |
| ⚠ Lĩnh vực bị quản lý | |
| Mô hình báo độ tin cậy thấp |
| ⚠ HITL dễ hỏng ở đâu | Vấn đề |
|---|---|
| ⚠ Người duyệt bấm đồng ý theo quán tính | ⚠ automation bias |
| ⚠ Khối lượng duyệt quá lớn | |
| ⚠ Người duyệt không đủ chuyên môn | |
| ⚠ Dấu hiệu hỏng | ⚠ tỷ lệ sửa gần bằng 0 |
| ⚠ Làm HITL cho hiệu quả | Cách |
|---|---|
| ⚠ Chỉ đưa lên người ca CẦN phán đoán | |
| ⚠ Hiển thị cơ sở để quyết nhanh | |
| ⚠ Đo tỷ lệ sửa | |
| Ghi phản hồi để cải thiện mô hình |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Tỷ lệ người duyệt sửa lại | ⚠ quá thấp là dấu hiệu xấu | | Người duyệt có đủ thời gian không | | | Ca nào thật sự cần người | ⚠ đưa quá nhiều làm hỏng cơ chế |
Và nghịch lý cần cảnh giác: HITL đặt sai chỗ có thể tệ hơn không có. Nó tạo cảm giác an toàn giả — trên giấy có người duyệt, nhưng người đó duyệt ba trăm ca mỗi ngày và chưa từng bác bỏ ca nào.
Which type of foundation model is specifically designed to understand and generate human language?
-
A
A. Multimodal model
-
B
B. Diffusion model
-
C
C. Predictive model
-
D
D. Large language model (LLM)
Xem giải thích
Đáp án
D — Large language model (LLM).
Vì sao đúng
Chính tên gọi đã nói lên tất cả: mô hình NGÔN NGỮ lớn — được thiết kế riêng để hiểu và sinh ngôn ngữ con người.
⚠ LLM làm được gì với ngôn ngữ:
⚠ Hiểu ý định trong câu hỏi
⚠ Sinh văn bản mạch lạc
⚠ Tóm tắt, dịch, viết lại
⚠ Trả lời câu hỏi
⚠ Sinh mã (cũng là một loại ngôn ngữ)
⚠ Từ khoá quyết định trong đề là "specifically" — chuyên biệt cho ngôn ngữ.
Vì sao các phương án khác sai
-
A (Multimodal model) — ⚠ bẫy mạnh nhất: mô hình đa phương thức CŨNG xử lý được ngôn ngữ, nhưng ⚠ nó xử lý NHIỀU loại dữ liệu (chữ, ảnh, âm thanh). Đề hỏi loại CHUYÊN BIỆT cho ngôn ngữ → LLM.
-
B (Diffusion model) — ⚠ sinh ẢNH, không phải ngôn ngữ.
-
C (Predictive model) — ⚠ mô hình dự báo, cho ra số hoặc nhãn.
Ghi nhớ
⚠ Bốn loại mô hình theo chuyên môn — bảng phải thuộc: | Loại | Chuyên cho | |---|---| | ⚠ LLM | ⚠ NGÔN NGỮ — đề này | | Diffusion | ⚠ ảnh, video | | Multimodal | ⚠ nhiều loại dữ liệu cùng lúc | | Predictive | ⚠ dự báo số, phân loại |
Từ khoá nhận diện:
"hiểu và sinh ngôn ngữ, chuyên biệt" → ⚠ LLM "chữ + ảnh + âm thanh cùng lúc" → ⚠ multimodal "sinh ảnh" → diffusion "dự đoán con số" → predictive
| ⚠ Ranh giới ngày càng mờ | Thực tế |
|---|---|
| ⚠ Gemini vừa là LLM vừa đa phương thức | |
| ⚠ Nhiều LLM hiện đại nhận cả ảnh | |
| ⚠ Nhưng ĐỀ THI vẫn phân biệt rõ | |
| Cách chấm | ⚠ đọc chữ "specifically" hoặc "primarily" |
| ⚠ LLM mạnh và yếu ở đâu | Mạnh/Yếu |
|---|---|
| ⚠ MẠNH: ngôn ngữ, tóm tắt, viết, dịch | |
| ⚠ MẠNH: hiểu ý định, phân loại văn bản | |
| ⚠ YẾU: tính toán chính xác | ⚠ nên gọi công cụ |
| ⚠ YẾU: sự thật cụ thể, mới | ⚠ cần RAG |
| YẾU: suy luận nhiều bước phức tạp | ⚠ cần chain-of-thought |
| ⚠ Vì sao "lớn" trong tên gọi | Lý do |
|---|---|
| ⚠ Hàng tỷ tham số | |
| ⚠ Huấn luyện trên lượng văn bản khổng lồ | |
| ⚠ Quy mô tạo ra năng lực bất ngờ | ⚠ emergent abilities |
| Đánh đổi | ⚠ đắt, chậm, khó giải thích |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Bài toán có phải về ngôn ngữ không | ⚠ không thì mô hình khác phù hợp hơn | | Có phép tính nào cần chính xác không | ⚠ giao cho công cụ | | Có cần đầu vào ảnh không | ⚠ thì cần mô hình đa phương thức |
Và mẹo đọc đề cho cả nhóm này: chữ "specifically" hoặc "primarily" là tín hiệu đề đang hỏi loại CHUYÊN BIỆT. Bỏ chữ đó đi thì mô hình đa phương thức cũng là câu trả lời chấp nhận được.
*Why is fine-tuning and customization an important factor when choosing a model?
-
A
A. It ensures the model is always available.
-
B
B. It increases the model's context window.
-
C
C. It allows the model to be adapted for specific tasks or domains.
-
D
D. It reduces the cost of using the model.
Xem giải thích
Đáp án
C — Vì nó cho phép mô hình được thích ứng cho những nhiệm vụ hoặc lĩnh vực cụ thể.
Vì sao đúng
Mô hình nền được huấn luyện cho tất cả mọi người, không phải riêng cho bài toán của bạn. Khả năng tinh chỉnh là cách thu hẹp khoảng cách đó.
⚠ Tinh chỉnh mang lại gì:
⚠ Thuật ngữ chuyên ngành
→ y khoa, pháp lý, tài chính
⚠ Giọng văn của tổ chức
→ nhất quán trên quy mô lớn
⚠ Định dạng đầu ra cụ thể
→ JSON theo schema riêng
⚠ Nhiệm vụ hẹp lặp lại
→ chính xác hơn mô hình chung
Vì sao các phương án khác sai
-
B (tăng cửa sổ ngữ cảnh của mô hình) — ⚠ sai kỹ thuật: cửa sổ ngữ cảnh là thuộc tính kiến trúc, tinh chỉnh không mở rộng nó.
-
D (giảm chi phí sử dụng mô hình) — ⚠ bẫy nửa đúng: tinh chỉnh có thể giảm chi phí vì prompt ngắn hơn và dùng được mô hình nhỏ hơn, ⚠ nhưng bản thân việc tinh chỉnh TỐN tiền và đó không phải mục đích chính.
-
A (đảm bảo mô hình luôn sẵn sàng) — ⚠ đó là tính sẵn sàng của dịch vụ, không liên quan.
Ghi nhớ
⚠ Năm tiêu chí chọn mô hình — bảng phải thuộc: | Tiêu chí | Câu hỏi | |---|---| | Modality | ⚠ xử lý loại dữ liệu nào | | Cửa sổ ngữ cảnh | ⚠ đầu vào dài bao nhiêu | | Chất lượng | ⚠ có đủ tốt cho việc này không | | Chi phí và độ trễ | | | ⚠ Tinh chỉnh, tuỳ biến | ⚠ thích ứng được cho lĩnh vực riêng — đề này |
Từ khoá nhận diện:
"thích ứng cho lĩnh vực, nhiệm vụ cụ thể" → ⚠ tinh chỉnh "đầu vào dài" → cửa sổ ngữ cảnh "luôn sẵn sàng" → SLA, tính sẵn sàng "giá mỗi token" → chi phí
| ⚠ Ba mức tuỳ biến — bảng phải thuộc | Mức |
|---|---|
| ⚠ Prompt engineering | ⚠ rẻ nhất, không đổi mô hình |
| ⚠ RAG | ⚠ thêm dữ liệu riêng lúc chạy |
| ⚠ Fine-tuning | ⚠ đổi trọng số, đắt nhất |
| Thứ tự thử | ⚠ từ rẻ tới đắt |
| ⚠ Không phải mô hình nào cũng tinh chỉnh được | Lưu ý |
|---|---|
| ⚠ Mô hình đóng qua API: tuỳ nhà cung cấp cho phép tới đâu | |
| ⚠ Mô hình mở: toàn quyền tinh chỉnh | ⚠ Gemma |
| ⚠ Đây là yếu tố CHỌN MÔ HÌNH thật sự | ⚠ nếu biết trước sẽ cần tinh chỉnh |
| Hệ quả | ⚠ chọn mô hình không tinh chỉnh được rồi mới cần là phải đổi cả hệ |
| ⚠ Điều kiện tinh chỉnh thành công | Điều kiện |
|---|---|
| ⚠ Đủ ví dụ chất lượng cao | ⚠ hàng trăm tới hàng nghìn |
| ⚠ Ví dụ NHẤT QUÁN | |
| ⚠ Nhiệm vụ ổn định | ⚠ đổi luôn thì phải huấn luyện lại |
| Có tập đánh giá riêng | |
| ⚠ Rủi ro | ⚠ quên kiến thức chung |
Ba việc kiểm chứng: | Việc | Cách | |---|---| | Đã thử prompt và RAG chưa | ⚠ tinh chỉnh là bước sau | | Mô hình định dùng có tinh chỉnh được không | ⚠ kiểm TRƯỚC khi chọn | | Dữ liệu tinh chỉnh có nhất quán không | |
Và lý do tiêu chí này quan trọng khi chọn chứ không chỉ khi dùng: đổi mô hình sau khi đã xây cả hệ thống là rất tốn kém. Biết trước mình sẽ cần tinh chỉnh thì phải loại ngay các mô hình không cho phép.