Tóm Tắt Khoa Học (Abstract) Bản Dịch Chuẩn
arXiv:2608.19235v1 [cs.DL]RAG đã trở thành kiến trúc phổ biến để kết nối LLM với tri thức doanh nghiệp. Hầu hết hệ thống hiện nay truy xuất tài liệu phi cấu trúc (PDF, wiki, tickets) rồi nạp vào LLM để tóm tắt. Tuy nhiên, một nhóm ngày càng tăng các enterprise agent phải truy vấn dữ liệu có cấu trúc: cơ sở dữ liệu quan hệ (RDBMS), kho dữ liệu và các analytics API, nơi câu trả lời là một kết quả được tính toán (computed result) chứ không phải một đoạn văn bản được truy xuất (retrieved passage). Việc truy vấn dữ liệu có cấu trúc buộc hệ thống phải đưa ra các quyết định mà document RAG không bao giờ phải đối mặt, được cấu trúc thành 7 chiều kiến trúc cốt lõi: (1) Ngữ nghĩa truy xuất, (2) Phân quyền, (3) Nhận diện ý định, (4) Phân giải thực thể, (5) Đánh giá, (6) Chế độ thất bại, và (7) Độ trễ. Nghiên cứu thực nghiệm chứng minh agent phân tầng (staged agent) triệt tiêu hoàn toàn vi phạm bảo mật và nâng độ chính xác từ 43% lên 95%.
Master Mind Map: Toàn Cảnh Nghiên Cứu
Cấu trúc 4 nhánh trọng tâm kết nối từ bản chất bài toán đến kiến trúc tham chiếu
So Sánh Hai Đường Ống (Pipeline Flow Comparison)
Tại sao mô hình Document RAG không thể áp dụng nguyên si cho dữ liệu có cấu trúc
Mục tiêu: Đọc đoạn văn bản và tổng hợp câu trả lời.
Mục tiêu: Dịch thành câu truy vấn hình thức, kiểm tra chính sách bảo mật, tính toán số liệu.
Sơ Đồ 7 Chiều Kiến Trúc (The Seven Architectural Dimensions)
Mỗi chiều là một sự phân kỳ mang tính nguyên tắc giữa Document RAG và Structured Data Agent
Ngữ Nghĩa Truy Xuất
Độ Mịn Phân Quyền
Nhận Diện Ý Định
Phân Giải Thực Thể
Giao Thức Đánh Giá
Chế Độ Thất Bại & Độ Trễ
Sơ Đồ Phân Loại 5 Chế Độ Thất Bại Table IV • Failure-Mode Taxonomy
5 rủi ro đặc thù mang tính hệ thống khi LLM Agent sinh và thực thi mã truy vấn trực tiếp trên cơ sở dữ liệu doanh nghiệp
Trong khi Document RAG chỉ dừng lại ở việc bỏ sót đoạn văn (*retrieval miss*) hoặc ảo giác câu chữ, Structured-Data Agent trực tiếp quyết định hành vi truy vấn thực thi (*executable behavior*). Sai sót ở đây dẫn đến rò rỉ dữ liệu, truy vấn sai lệch ngữ nghĩa, hoặc trả kết quả rỗng âm thầm.
Ảo Giác Lược Đồ
Schema Hallucination
Sai Khóa Nối
Wrong Joins
Nhầm Định Danh
Identifier Confusion
Rò Rỉ Phân Quyền
Auth Leakage
Tập Con Âm Thầm
Silent Data Subset
Ảo Giác Lược Đồ (Schema Hallucination)
LLM tự suy diễn và bịa ra các bảng (*tables*) hoặc cột (*columns*) hoàn toàn không tồn tại trong cơ sở dữ liệu doanh nghiệp.
Truy vấn gãy vỡ ngay lập tức tại tầng thực thi, gây lỗi gián đoạn chuỗi tác vụ hoặc trả về thông báo lỗi vô nghĩa cho người dùng.
Schema Registry tất định: Chỉ cung cấp lược đồ đã qua kiểm định; chốt kiểm tra tĩnh (static schema validation) trước khi gửi truy vấn tới DB.
Sai Khóa Nối (Wrong Joins)
Các bảng được nối (JOIN) trên các trường sai ngữ nghĩa. Truy vấn hoàn toàn đúng cú pháp SQL nhưng sai bản chất nghiệp vụ.
Nối trên trường trùng tên hoặc ngộ nhận: ví dụ nối account_number (số tài khoản thanh toán) với service_id (mã thuê bao) khiến dữ liệu bị nhân bản sai lệch.
Semantic Graph & Foreign-Key Constraints: Buộc LLM tuân thủ đồ thị quan hệ hình thức, không cho phép tự ý nối bảng ngoài các cạnh hợp lệ đã định nghĩa.
Nhầm Lẫn Mã Định Danh (Identifier Confusion)
Hệ thống dùng lẫn lộn giữa các loại mã định danh khác nhau của cùng một khách hàng trong hệ sinh thái doanh nghiệp.
Một người dùng có đồng thời: Mã KH (customer_id), Số hợp đồng (contract_no), Số tài khoản (billing_id), và Mã thiết bị (device_id). LLM không thể tự phân biệt nếu không có siêu dữ liệu kiểu.
Entity Resolution & Điểm ngắt làm rõ: Khi mã nhập vào không đủ thông tin nhận diện loại, hệ thống dừng lại hỏi người dùng thay vì đoán mò.
Rò Rỉ Phân Quyền Qua Tóm Tắt (Auth Leakage)
Khi LLM tóm tắt kết quả đa miền, dù bản ghi cấm đã bị lọc bỏ trước đó, câu trả lời vẫn vô tình làm lộ sự tồn tại của miền dữ liệu bí mật.
Trả lời: "Tôi không thể truy xuất dữ liệu phiếu hỗ trợ nội bộ của bạn" → Vô tình xác nhận phiếu hỗ trợ đó có tồn tại và hệ thống đã tìm thấy nó.
Neutral Denial Templates: Định dạng từ chối đồng nhất ngoài LLM, ranh giới phản hồi kiểm soát cấu trúc câu trả lời để không để lộ cấu trúc bảng hay trạng thái truy vấn.
Tập Con Dữ Liệu Âm Thầm (Silent Data Subset)
Truy vấn chạy trơn tru 100%, không trả về bất kỳ lỗi nào, nhưng kết quả trả về bị thiếu hụt một phần dữ liệu quan trọng mà người dùng không hề hay biết.
LLM bỏ quên một điều kiện WHERE bắt buộc (như status = 'ACTIVE', hoặc loại trừ bản ghi tạm) hoặc thiếu một nhánh ánh xạ ID đa nguồn.
Policy Injection & Benchmark Đối Chứng: Tự động tiêm các mệnh đề lọc bắt buộc từ Policy Engine trước khi thực thi; kiểm thử liên tục với 21 truy vấn chuẩn.
Bằng Chứng Thực Nghiệm: Baseline vs. Staged Agent
Kết quả thử nghiệm có đối chứng (n = 21 câu hỏi, 4 vai trò, 2 nguồn dữ liệu độc lập)
| Chỉ Số Đánh Giá (Metric) | Baseline (Trực tiếp) | Staged Agent |
|---|---|---|
| Độ chính xác kết quả (Outcome Accuracy) | 0.43 | 0.95 (+52%) |
| Số lần vi phạm chính sách (Policy Violations) | 7 vi phạm | 0 (Triệt tiêu) |
| Tỷ lệ rò rỉ dữ liệu (Leakage Rate) | 0.33 (33%) | 0.00 (0%) |
| Câu trả lời sai nhưng tự tin (Confidently Wrong) | 8 câu | 0 câu |
| Độ chính xác khi từ chối (Refusal Accuracy) | 0.00 | 1.00 (100%) |
| Khả năng quy kết nguyên nhân lỗi (Failure Attribution) | 0.33 | 1.00 (100%) |
Độ chính xác tăng nhờ kiến trúc, không phải do LLM thông minh hơn!
Khi cả hai agent cùng quyết định trả lời, độ đúng đắn câu trả lời là giống hệt nhau (0.90).
Mức nhảy vọt từ 0.43 lên 0.95 hoàn toàn đến từ:
- Biết kiềm chế từ chối khi thực thể bị mơ hồ;
- Chặn đứng các truy vấn vượt quá quyền hạn (Role/Tenant);
- Loại bỏ các phép nối (JOIN) chéo nguồn không hợp lệ.
Mind Map: 4 Bài Toán Mở (Open Architectural Problems)
Những giới hạn lớn mà ngành công nghiệp AI doanh nghiệp hiện chưa giải quyết trọn vẹn
Soạn Thảo Truy Vấn Xuyên Miền
Khi câu hỏi đòi hỏi dữ liệu từ nhiều database không có quan hệ khóa ngoại (Foreign Key) trực tiếp: Agent phải đánh đổi giữa phép nối liên kết lỏng (federated join), gọi tuần tự chuỗi API, hay tổng hợp ở tầng ứng dụng? Mỗi lựa chọn đều ảnh hưởng nghiêm trọng đến độ trễ và tính toàn vẹn phân quyền.
Quản Lý Sự Tiến Hóa Của Lược Đồ
Cơ sở dữ liệu doanh nghiệp liên tục thay đổi (thêm cột, đổi kiểu dữ liệu, bỏ bảng cũ). Hệ thống cần cơ chế phát hiện trôi dạt siêu dữ liệu (metadata drift), đảm bảo tương thích ngược và ngăn không cho prompt LLM nhận các schema đã lỗi thời.
Thẻ Truy Vấn (Query Card) & Giải Thích
Khác với RAG tài liệu có thể trích dẫn trực tiếp câu văn nguồn, dữ liệu có cấu trúc trả về con số tính toán. Người dùng nghiệp vụ không thể đọc mã SQL thô. Cần cơ chế sinh "Query Card" bằng ngôn ngữ tự nhiên, giải thích rõ cách tính mà không làm lộ cấu trúc cơ sở dữ liệu nhạy cảm.
Đánh Giá Chuẩn Ở Quy Mô Doanh Nghiệp
Các benchmark hiện nay (Spider, BIRD) chỉ đo khả năng text-to-SQL đơn lẻ trên schema tĩnh. Thế giới thực cần một benchmark chuẩn mực bao gồm: phân quyền đa vai trò, phân giải thực thể mơ hồ, dữ liệu không đồng nhất và hành vi từ chối an toàn.
"Khách hàng nào có hóa đơn quá hạn mà đồng thời có phiếu hỗ trợ kỹ thuật chưa giải quyết?"
Kịch bản này đòi hỏi agent xử lý đồng thời 2 miền dữ liệu (Tài chính & Hỗ trợ kỹ thuật). Thay vì chỉ dùng 1 prompt đơn độc, Governed Structured-Data Agent thực hiện tuần tự qua 7 bước:
Xác định phép so sánh chéo giữa Finance và Support. Đầu ra là tập thực thể (Entity Set).
Xác minh người dùng có quyền truy cập đồng thời cả hóa đơn và phiếu hỗ trợ hay không.
Schema Registry tìm đường nối khóa ngoại (Customer_ID) hợp lệ giữa 2 bảng.
Thực thi an toàn và trả về danh sách kèm Query Card giải thích logic rõ ràng.