Ảnh đại diện bài: Định dạng nội dung AI trích dẫn: bảng, danh sách hay số liệu
Chiến thuật & sai lầm

Định dạng nội dung AI trích dẫn: bảng, danh sách hay số liệu

· 18 phút đọc · Đăng 12/08/2026 · Cập nhật 12/08/2026

Trả lời nhanhĐịnh dạng nội dung AI trích dẫn: chỉ số liệu và trích dẫn nguyên văn có bằng chứng đo được. Bài tách rõ cái đã đo, cái chỉ hợp lý và cái là đồn.

Trả lời nhanh: Trong ba thứ hay được khuyên khi nói về định dạng nội dung AI trích dẫn - bảng, danh sách và số liệu - chỉ số liệu có bằng chứng đo được. Nghiên cứu GEO công bố tại hội nghị KDD 2024 thử 9 cách viết lại nội dung trên 10.000 truy vấn. Ba cách thắng rõ là thêm trích dẫn nguyên văn, thêm số liệu và dẫn nguồn, mỗi cách nâng mức được nhắc tới khoảng 30-40%. Nhồi từ khóa gần như không đổi được gì. Bảng và danh sách thì khác: chúng có lý do cấu trúc hợp lý - dễ tách thành khối trả lời trọn một ý - nhưng mọi con số đang lan truyền về chúng đều đến từ công ty bán dịch vụ, không ai công bố cách đo. Vậy nên mình vẫn dùng bảng và danh sách, nhưng vì chúng giúp người đọc và giúp máy tách khối, không phải vì một tỷ lệ nào cả.

Hỏi về định dạng nội dung AI trích dẫn thật ra là ba câu hỏi khác nhau

Chỗ này quyết định cả bài, nên mình muốn tách rõ trước khi đi vào chi tiết. Khi bạn hỏi định dạng nào giúp được AI trích dẫn, bạn đang gộp ba việc rất khác nhau vào một câu:

  1. Máy có lấy được đoạn đó ra không? Answer engine không đọc cả trang rồi mới quyết định. Nó lấy về từng đoạn ứng viên. Định dạng ảnh hưởng ở chỗ đoạn của bạn khi bị tách ra khỏi trang thì còn hiểu được hay không.
  2. Đoạn đó có đáng tin không? Một câu có con số kèm nguồn khác hẳn một câu khen chung chung. Đây là chỗ định dạng tác động mạnh nhất, và cũng là chỗ có bằng chứng đo được.
  3. Mô hình có ghép được vào câu trả lời không? Mô hình đang viết một đoạn văn xuôi cho người dùng. Thứ nó ghép vào dễ nhất là một mệnh đề hoàn chỉnh, không phải một ô trong bảng.

Ba việc này đòi ba thứ khác nhau. Trộn lại rồi đi tìm “định dạng tốt nhất” là lý do nhiều hướng dẫn nghe hợp lý mà làm theo không thấy gì. Cơ chế đầy đủ của việc lấy đoạn và ghép câu trả lời nằm ở bài answer engine trích dẫn nguồn thế nào.

Bằng chứng mạnh nhất hiện có: nghiên cứu thử 9 cách viết lại

Đây là nghiên cứu mình dựa vào nhiều nhất khi nói về định dạng, vì nó là bài bình duyệt chứ không phải blog bán hàng.

Nhóm tác giả GEO (arXiv 2311.09735, công bố tại hội nghị KDD 2024) dựng một bộ dữ liệu tên GEO-Bench gồm 10.000 truy vấn thuộc 25 lĩnh vực. Với mỗi truy vấn, họ lấy các trang nguồn, viết lại theo 9 cách khác nhau, rồi đo xem cách nào làm nội dung được nhắc tới nhiều hơn trong câu trả lời do máy sinh ra.

Cách viết lại nội dungLàm gì cụ thểKết quả
Thêm trích dẫn nguyên vănChèn câu trích từ nguồn có thật, để trong ngoặc kép, ghi rõ ai nóiTăng mạnh nhất, khoảng 41%
Thêm số liệuThay câu định tính bằng con số cụ thểTăng khoảng 40%
Dẫn nguồnGắn nguồn cho từng khẳng địnhTăng khoảng 30-40%
Viết giọng có căn cứBỏ giọng quảng cáo, viết chắc chắn và có cơ sởTăng nhỏ hơn, không đều giữa các lĩnh vực
Viết dễ hiểuĐơn giản hóa câu chữTăng nhỏ hơn, không đều
Trau chuốt câu vănLàm câu trôi chảy hơnTăng nhỏ hơn, không đều
Thêm từ ngữ ít gặpDùng từ lạ, ít trùng với bài khácÍt tác động
Thêm thuật ngữ chuyên ngànhDùng từ chuyên môn của lĩnh vựcÍt tác động
Nhồi từ khóaLặp từ khóa nhiều lầnGần như không cải thiện gì

Hai điều đọng lại từ bảng này.

Thứ nhất, ba cách thắng đều không phải là “định dạng” theo nghĩa hình thức. Chúng là bằng chứng: một con số, một câu trích có người chịu trách nhiệm, một nguồn dẫn được. Cái mô hình phản ứng mạnh là chất lượng của khẳng định, không phải cái khung bao quanh nó.

Thứ hai, nhồi từ khóa hết tác dụng. Đây là điểm nghiên cứu nhấn mạnh: một mẹo cũ của SEO gần như không đổi được gì với máy sinh câu trả lời. Nếu bạn còn đang tính mật độ từ khóa như cách làm mười năm trước, đây là chỗ nên dừng.

Một điều thành thật cần nói: nghiên cứu này đo trên một máy sinh câu trả lời do nhóm tự dựng, không phải đo trực tiếp trên ChatGPT hay Perplexity thật. Kết quả cho biết hướng rất rõ, nhưng con số 40% không nên hiểu là “làm vậy thì lượt trích tăng 40%” trên nền tảng thật. Nhóm tác giả cũng ghi rõ hiệu quả thay đổi theo từng lĩnh vực.

Biểu đồ thanh: thêm trích dẫn nguyên văn tăng khoảng 41%, thêm số liệu 40%, dẫn nguồn 30-40%, nhồi từ khóa gần như 0%
Nguồn: nghiên cứu GEO, hội nghị KDD 2024, 10.000 truy vấn. Đo trên máy sinh câu trả lời tự dựng - dùng hướng, đừng dùng con số.

Vì sao số liệu và trích dẫn nguyên văn lại thắng

Kết quả trên nghe hơi bất ngờ nếu bạn quen nghĩ theo kiểu “trình bày đẹp thì được chọn”. Nhưng nhìn từ cách máy làm việc thì nó rất hợp lý.

Một con số là một mẩu sự thật đứng một mình được. “Nghiên cứu GEO đo trên 10.000 truy vấn thuộc 25 lĩnh vực” mang trọn nghĩa dù bạn cắt nó ra khỏi mọi thứ xung quanh. Còn “nghiên cứu GEO đo trên một bộ dữ liệu lớn” thì cắt ra là mất nghĩa - lớn là bao nhiêu, so với cái gì? Máy lấy nội dung theo từng đoạn, nên thứ giữ nguyên nghĩa sau khi bị cắt là thứ sống sót.

Một con số kiểm lại được. Mô hình đang phải chọn giữa nhiều trang nói cùng một chuyện. Trang đưa con số cụ thể kèm nguồn thì trả lời được câu “dựa vào đâu”, trang khen chung chung thì không. Khi câu trả lời cuối phải kèm chú thích cho người đọc bấm vào, nguồn có thể kiểm là nguồn dễ được chọn.

Một con số làm bạn khác đi. Mười bài viết cùng nói “nội dung mới thì tốt hơn” thì chín bài là hàng chợ. Bài đưa được con số riêng, đo được, có ngày tháng là bài duy nhất đáng trích. Đây cũng đúng với hướng dẫn của Google: thứ họ khuyến khích là nội dung độc đáo, không phải nội dung ai cũng viết được.

Điều này nối thẳng vào cách chia khối: mỗi đoạn nên trọn một ý và đọc riêng vẫn hiểu. Cách làm chi tiết nằm ở content chunking - chia khối nội dung.

Bảng: lý do đúng, nhưng có một cái bẫy ít ai nói

Mình vẫn dùng bảng nhiều, kể cả trong bài này. Lý do cấu trúc rất chắc: một bảng so sánh ép bạn phải nói rõ từng tiêu chí, và nó biến một đoạn văn lằng nhằng thành các mệnh đề tách bạch.

Nhưng có một cái bẫy. Khi trang bị cắt thành các đoạn ứng viên, bảng dễ bị tách khỏi dòng tiêu đề của nó. Lúc đó một dòng trong bảng trông như thế này:

ChatGPT | Có | Chậm

Đọc dòng đó, bạn không biết “có” là có cái gì và “chậm” là chậm ở khâu nào. Máy cũng vậy. Bảng của bạn có thể rất gọn trên màn hình mà vẫn vô dụng khi bị lấy ra khỏi trang.

Ba việc sửa, đều rẻ:

1. Viết một câu kết luận ngay trên bảng. Câu đó phải chứa ý chính của cả bảng, đứng riêng vẫn hiểu. Ví dụ: “Tỷ lệ nhắc tên thương hiệu chênh nhau rất xa giữa các nền tảng, ChatGPT thấp nhất và Perplexity cao nhất.” Nếu máy chỉ lấy được câu đó thôi thì bạn vẫn được trích đúng ý.

2. Cột đầu tiên phải gọi tên đầy đủ. Đừng để cột đầu là “Loại 1”, “Loại 2” rồi giải nghĩa ở đâu đó phía trên.

3. Đừng để một con số quan trọng chỉ nằm trong bảng. Nếu con số nào là điểm chính của cả mục, hãy nhắc lại nó trong một câu văn xuôi. Bảng để tra cứu, câu văn để được trích.

Ví dụ trước - sau, cùng một nội dung:

Cách viết
Trước(bảng so sánh 3 nền tảng, không có câu dẫn nào phía trên)
Sau”Ba nền tảng chọn nguồn theo ba kiểu khác nhau, nên một bài lọt vào Perplexity chưa chắc lọt vào ChatGPT.” + đúng bảng đó

Bản “sau” không đẹp hơn. Nó chỉ có thêm một câu. Nhưng câu đó là thứ có thể bị lấy ra và ghép vào câu trả lời của máy, còn cái bảng thì thường không.

Danh sách: giúp khi nào, làm loãng khi nào

Danh sách gạch đầu dòng bị lạm dụng nhiều nhất trong ba định dạng. Nó giúp thật, nhưng chỉ ở một số kiểu nội dung.

Danh sách giúp khi nội dung vốn đã là một tập hợp đếm được:

  • Các bước theo thứ tự (dùng danh sách đánh số, mỗi bước một câu mệnh lệnh rõ chủ ngữ).
  • Một nhóm phần tử ngang hàng có tên riêng, ví dụ ba con bot của OpenAI.
  • Các lựa chọn kèm điều kiện áp dụng.

Danh sách làm loãng khi:

  • Mỗi gạch đầu dòng là một mẩu câu cụt, không có chủ ngữ. “Nhanh hơn” - nhanh hơn cái gì?
  • Bạn dùng nó để né việc giải thích. Một danh sách 8 tính từ không thay được một đoạn nói rõ vì sao.
  • Bạn cắt một lập luận liền mạch thành các gạch đầu dòng rời rạc. Lập luận cần chữ “vì” và “nên”, danh sách thì nuốt mất hai chữ đó.

Phép thử mình hay dùng: che phần còn lại của trang, đọc riêng một gạch đầu dòng. Nếu nó vẫn là một câu hoàn chỉnh và vẫn đúng, danh sách đó ổn. Nếu không, viết lại thành câu đầy đủ hoặc gộp về đoạn văn.

Google nói gì chính thức về định dạng nội dung cho AI

Đây là phần mình khuyên đọc kỹ, vì nó bác bỏ vài mẹo đang được bán khá đắt. Google có một tài liệu chính thức hướng dẫn tối ưu cho các tính năng AI trên Tìm kiếm, và họ nói khá thẳng.

Về cấu trúc, khuyến nghị của họ nhạt đến mức dễ gây thất vọng: viết cho con người đọc, tổ chức nội dung bằng đoạn và mục, kèm tiêu đề tạo cấu trúc rõ ràng. Hết. Không có bí kíp định dạng nào.

Về những thứ không cần làm, họ nói rõ hơn nhiều:

  • Không cần tạo file máy đọc riêng cho AI - không cần file văn bản kiểu llms.txt, không cần markup đặc biệt, không cần bản Markdown. Mình đã bàn kỹ chuyện này ở bài llms.txt là gì.
  • Không có yêu cầu phải chẻ nội dung thành từng mẩu nhỏ để AI hiểu.
  • Không cần lo gom đủ mọi biến thể từ khóa dài.

Câu thứ hai nghe như mâu thuẫn với lời khuyên chia khối, nên mình nói rõ: chia khối không phải là yêu cầu của Google, và chẻ bài thành trăm mẩu vụn thì hại nhiều hơn lợi. Cái vẫn đúng là mỗi đoạn nên trọn một ý và đọc riêng vẫn hiểu - không phải để làm vừa lòng một cỗ máy, mà vì máy lấy nội dung theo từng đoạn nên đoạn nào tự đứng được thì đoạn đó có cơ hội. Hai chuyện khác nhau.

Tài liệu này cũng nhắc lại một điểm hợp với nghiên cứu GEO ở trên: thứ được ưu tiên là nội dung độc đáo, không phải nội dung hàng chợ mà ai có công cụ tìm kiếm cũng viết ra được. Định dạng không cứu được một bài không có gì mới.

Những con số về định dạng đang lan truyền - và vì sao mình không dùng

Tra tiếng Anh lẫn tiếng Việt về chủ đề này, bạn sẽ gặp một loạt con số nghe rất thuyết phục. Mình liệt kê ra đây, không phải để bạn dùng, mà để bạn nhận ra khi gặp lại.

Con số đang lan truyềnVì sao mình không dùng
”Bài dạng so sánh chiếm 32,5% tổng lượt trích dẫn của AI”Không nói đo trên nền tảng nào, cỡ mẫu bao nhiêu, phân loại “bài so sánh” theo tiêu chí gì
”Hướng dẫn có bảng dữ liệu đạt tỷ lệ được trích 67%“Tỷ lệ 67% trên mẫu nào, so với nhóm đối chứng nào? Không công bố
”Bảng ghép danh sách làm lượt trích ở Perplexity tăng 1,5 lần”Con số của một công ty bán công cụ, không có cách kiểm lại
”Câu có phần trăm hoặc số tiền được trích nhiều gấp 4 lần”Nghe rất giống kết luận của nghiên cứu GEO nhưng phóng đại lên, và không dẫn nguồn gốc

Điểm chung: chúng đều đến từ đơn vị có sản phẩm để bán, không công bố cỡ mẫu, không công bố cách đo, và không ai lặp lại được. Đây đúng là kiểu số liệu mà chính bài này khuyên bạn đừng viết.

Vậy mình tin cái gì? Tin lý do cấu trúc, và tin nghiên cứu bình duyệt. Lý do cấu trúc thì kiểm được bằng đầu: máy lấy theo đoạn, nên đoạn tách ra vẫn hiểu thì có lợi. Nghiên cứu GEO thì có bộ dữ liệu, có cách đo, có người khác lặp lại được. Còn một tỷ lệ đẹp không kèm cách đo thì mình xếp cùng ngăn với quảng cáo. Cách phân biệt tương tự áp dụng cho schema và độ mới nội dung, mình đã viết ở sự thật về schema và độ mới.

Bảng tra nhanh: câu hỏi kiểu nào hợp định dạng nào

Không có một định dạng nội dung AI trích dẫn nào thắng mọi trường hợp. Định dạng nên chọn theo câu hỏi người dùng đang hỏi, không theo sở thích trình bày. Bảng dưới là cách mình quyết định.

Người dùng hỏi kiểuĐịnh dạng hợp nhấtVì sao
”X là gì”Một đoạn 2-4 câu trả lời thẳng, đặt ngay dưới tiêu đề mụcMáy cần một định nghĩa gọn để ghép vào câu trả lời
”X khác Y thế nào”Một câu kết luận rồi mới tới bảng so sánhCâu kết luận là thứ được trích, bảng là thứ để người đọc tra
”Làm X thế nào”Danh sách đánh số, mỗi bước một câu mệnh lệnh đủ chủ ngữCác bước có thứ tự, và mỗi bước đứng riêng vẫn hiểu
”Nên chọn cái nào”Bảng tiêu chí kèm một câu khuyến nghị có điều kiệnKhuyến nghị trần dễ sai, khuyến nghị kèm điều kiện thì trích được
”Bao nhiêu, khi nào, từ năm nào”Một câu chứa con số kèm nguồn và mốc thời gianĐây là loại câu được trích nhiều nhất, theo nghiên cứu GEO
”Vì sao X”Đoạn văn có “vì” và “nên”, đừng bẻ thành gạch đầu dòngLập luận bị cắt vụn là lập luận mất mạch

Điểm chung của cả sáu dòng: luôn có một câu văn xuôi mang trọn ý, đặt trước phần trình bày. Bảng và danh sách hỗ trợ cho câu đó, không thay được nó. Cách viết câu mở đầu ấy mình đã bàn riêng ở bài trả lời thẳng - answer-first.

Năm việc nên làm trong tuần này

Nếu chỉ có một buổi để sửa, đây là thứ tự mình khuyên.

  1. Rà 5 bài quan trọng nhất, tìm câu định tính có thể thay bằng con số. “Nhiều người dùng” thành “khoảng 40% người được hỏi, theo khảo sát X tháng 5/2026”. Đây là việc có bằng chứng mạnh nhất trong cả bài.
  2. Gắn nguồn cho mọi con số đang có. Nếu có con số mà bạn không tìm lại được nguồn, xóa nó đi. Con số không nguồn hại hơn không có con số.
  3. Mỗi bảng thêm một câu kết luận ngay phía trên. Việc rẻ nhất trong danh sách này và sửa đúng cái bẫy ở mục trên.
  4. Kiểm từng danh sách bằng phép thử che trang. Gạch đầu dòng nào không đứng riêng được thì viết lại thành câu đủ.
  5. Đừng đổi hết bài thành bảng. Một trang toàn bảng là một trang không có lập luận nào, và đó là kiểu nội dung hàng chợ mà cả Google lẫn nghiên cứu GEO đều cho thấy là không được ưu tiên.

Làm xong năm việc này là bạn đã đi qua phần lớn những gì thật sự có bằng chứng về định dạng nội dung AI trích dẫn. Phần còn lại là viết cho hay và có thứ đáng để người khác trích.

Danh sách rộng hơn về những việc có bằng chứng và những việc chỉ được đồn: tối ưu cho AI search. Toàn bộ tuyến chiến thuật nằm ở chuyên mục chiến thuật.

Câu hỏi thường gặp

Định dạng nội dung AI trích dẫn nhiều nhất là gì? Theo bằng chứng đo được hiện có, thứ tác động mạnh nhất không phải là bảng hay danh sách mà là nội dung có số liệu, có trích dẫn nguyên văn và có dẫn nguồn. Nghiên cứu GEO (KDD 2024) đo ba cách này cho mức tăng khoảng 30-40%, trong khi nhồi từ khóa gần như không đổi được gì.

Viết bảng so sánh có giúp được AI trích dẫn không? Có ích, nhưng gián tiếp. Bảng ép bạn nói rõ từng tiêu chí, đó là cái lợi thật. Rủi ro là khi trang bị cắt thành đoạn, một dòng bảng tách khỏi tiêu đề cột thì mất nghĩa. Cách sửa: luôn viết một câu kết luận ngay phía trên bảng và đừng để con số quan trọng chỉ nằm trong bảng.

Có nên chuyển hết nội dung thành danh sách gạch đầu dòng không? Không nên. Danh sách hợp với các bước và các tập hợp đếm được. Với câu hỏi “vì sao”, đoạn văn có lập luận vẫn tốt hơn, vì gạch đầu dòng nuốt mất mạch “vì - nên”. Google cũng khuyến nghị tổ chức bằng đoạn và mục kèm tiêu đề rõ, không khuyến nghị bẻ vụn.

Google có yêu cầu định dạng đặc biệt nào cho AI không? Không. Tài liệu chính thức của Google nói rõ bạn không cần tạo file máy đọc riêng, file văn bản cho AI, markup hay bản Markdown, và không có yêu cầu phải chẻ nội dung thành từng mẩu nhỏ. Khuyến nghị của họ chỉ là viết tốt và tổ chức rõ.

Thêm số liệu vào bài thì bao nhiêu là đủ? Không có con số cố định. Nguyên tắc dùng được: mỗi mục H2 nên có ít nhất một khẳng định cụ thể kiểm lại được - một con số, một tên riêng, một mốc thời gian, hoặc một câu trích có người chịu trách nhiệm. Nhồi số cho đủ chỉ tiêu thì phản tác dụng, giống hệt nhồi từ khóa.

Vì sao các bài khác đưa ra tỷ lệ cụ thể cho bảng và danh sách, còn bài này thì không? Vì mình không tìm được cách kiểm lại các tỷ lệ đó. Chúng gần như đều đến từ đơn vị bán công cụ, không công bố cỡ mẫu cũng không công bố cách đo. Mình chọn nói rõ cái nào đo được, cái nào chỉ hợp lý về mặt cấu trúc, thay vì mượn một con số nghe cho chắc.

Liên quan

Nguồn

  • Aggarwal và cộng sự, GEO: Generative Engine Optimization - arXiv 2311.09735, công bố tại hội nghị KDD 2024. GEO-Bench: 10.000 truy vấn, 25 lĩnh vực; 9 phương pháp viết lại được đo bằng hai chỉ số hiển thị.
  • Google Search Central, Guide to optimizing for generative AI features on Google Search - developers.google.com/search/docs/fundamentals/ai-optimization-guide.
  • Google Search Central Blog, Top ways to ensure your content performs well in Google’s AI experiences on Search - 21/5/2025.
#định-dạng#chiến-thuật#aeo#geo#nội-dung

Đọc tiếp