Custom Corpus란 무엇인가: 검색 순위 1위 페이지도 AI 답변에서 탈락하는 이유

Google AI Mode(AI 모드)는 웹 전체를 뒤져 답을 찾지 않습니다. 질문이 들어올 때마다 새로 구성하는 Custom Corpus(커스텀 코퍼스)라는 문서 집합 안에서만 답을 만듭니다. 검색 순위 1위 페이지가 AI 답변에서 사라지는 현상도, 내 콘텐츠를 AI가 인용하게 만드는 방법도 모두 이 문서 집합에서 출발하기 때문에, Custom Corpus는 GEO(Generative Engine Optimization, 생성형 엔진 최적화)의 출발점이 되는 개념입니다. 이 글은 네 가지 질문에 답합니다. Custom Corpus란 무엇인가, 어떻게 구성되는가, 왜 검색 순위 1위 페이지도 인용되지 않는가, 인용되려면 무엇을 점검해야 하는가.

Google AI Mode의 Custom Corpus란 무엇인가: 질문마다 새로 구성되는 답변 재료

Google AI Mode의 Custom Corpus는 사용자의 질문에 맞춰 그때그때 새로 추려내는 답변 재료용 문서 묶음입니다. Google AI Mode는 질문 하나를 받으면 수십 개의 확장 질문을 만들고, 그 질문들로 검색 색인의 수천억 개 문서 가운데 관련 단락(Passage)만 골라 작은 묶음으로 추립니다. 이 용어는 Google 특허 US2024/0362093A1에 등장하며, 검색 분석 기업 iPullRank는 이 집합을 "색인의 좁은 조각(narrow slice of the index)"이라고 설명합니다(How AI Mode Works). Custom Corpus 안에는 여러 문서(Document)가 담기고, 각 문서는 다시 여러 단락(Passage)으로 나뉩니다. AI가 골라 쓰는 최소 단위가 바로 이 단락입니다. 참고로 Custom Corpus를 AI에게 물으면 Vertex AI의 corpus나 Google One의 맞춤 데이터 소스 같은 제품 기능 질문으로 확장되기 쉬운데, 이들은 이름만 비슷한 별개의 기능입니다.

Custom Corpus는 어떻게 구성되는가: 질문 확장에서 단락 선별까지 4단계

Custom Corpus는 질문 확장 → 의미 좌표 변환 → 의미 검색 → 단락 선별의 4단계로 구성됩니다. 사용자가 질문 하나를 입력하면 Google AI Mode는 곧바로 답을 찾으러 가지 않고, 질문 뒤에 숨은 확장 질문부터 만들어냅니다(Query Fan-Out, Google 특허 WO2024064249A1). 이 질문들이 검색어가 되어 색인에서 재료를 모읍니다. 말하자면 AI는 장보기 목록부터 쓴 뒤에 장을 보러 갑니다.

구성 단계하는 일
① 질문 확장 (Query Fan-Out)하나의 질문 뒤에 숨은 확장 질문 수십~수백 개를 만들어낸다.
② 의미 좌표 변환 (Vector Embedding)확장 질문과 문서·단락을 수백~수천 차원의 숫자 좌표로 바꾼다
③ 의미 검색 (Semantic Search)좌표 사이의 거리(코사인 유사도)로 질문과 가까운 후보 문서를 추린다
④ 단락 선별후보 문서 안의 단락을 하나씩 평가해, 통과한 단락만 모아 Custom Corpus를 완성한다.

Custom Corpus 구성의 핵심 특징은 마지막 선별이 페이지가 아니라 단락(Passage) 단위로 이뤄진다는 점입니다. Google은 2020년 10월 단락 단위 관련성 평가를 도입하면서 전체 검색 쿼리의 약 7%가 개선될 것이라고 밝혔고(Google 공식 블로그 "How AI is powering a more helpful Google", 2020-10-15), Custom Corpus가 이 평가 방식을 답변 재료 선별의 기본 단위로 쓴다는 것이 iPullRank의 분석입니다. 그 결과 Custom Corpus에 담기는 것은 '잘 만든 페이지'가 아니라 '확장 질문에 답하는 단락'입니다.

왜 검색 순위 1위 페이지도 AI 답변에 인용되지 않는가

검색 순위 1위 페이지도 AI 답변에서 인용되지 않을 수 있습니다. 오류가 아니라 구조적인 결과입니다. 인용은 문서(페이지) 순위와 별개로, 단락 단위에서 결정되기 때문입니다. Google AI Mode는 Custom Corpus에 담긴 단락들을 질문 하나당 1:1로 맞붙여 더 잘 답하는 쪽을 고르고(Google 특허 US2025/0124067A1), 답변을 만든 뒤에는 출처로 표시할 단락을 다시 따로 심사합니다. iPullRank는 이 구조를 "일부 조각만 인용되고 다수는 인용되지 않는다(Some chunks are cited; many are not)", "인용 선택은 문서 순위와 독립적으로 일어난다(citation selection happens independently of document rank)"라고 기술합니다. 다만 Google의 공식 확인은 없으며, 공개 특허와 iPullRank 분석에 근거한 설명입니다.

페이지 순위는 Custom Corpus 진입을 보장하지 않습니다. 페이지 전체가 아니라 단락 하나가 Custom Corpus에 담겨야 인용 후보가 되므로, 검색 순위 1위 페이지라도 단락이 선별되지 못하면 AI 답변에서는 존재하지 않는 것과 같습니다.

AI에 인용되려면 무엇을 점검해야 하는가: 단락이 인용까지 통과하는 세 관문

AI 답변에 인용되려면 내 단락이 세 관문을 차례로 통과해야 합니다. 첫 관문은 Custom Corpus에 들어가는 것이고, 그 다음이 답변 재료로 뽑히는 것, 마지막이 출처로 표시되는 것입니다. 세 관문의 심사 기준은 SEO(검색엔진 최적화)의 순위 기준과는 별개입니다. 키워드 밀도나 백링크처럼 검색 순위를 만들던 요소는 세 관문 어디에도 직접 작용하지 않습니다. 다만 후보 문서 자체는 검색 색인에서 나오므로, 순위 요소가 간접적으로 영향을 줄 가능성까지 배제된 것은 아닙니다.

관문심사 내용여기서 탈락하는 단락
① 진입(Custom Corpus에 담기는가)확장 질문의 답이 되는가, 앞뒤 문맥 없이 단락만 읽어도 이해되는가"이것은·해당 기술은"처럼 앞 문맥 없이는 읽히지 않는 단락
② 선택(답으로 뽑히는가)같은 질문을 놓고 다른 단락과 1:1 비교해, 더 잘 답하는 쪽을 고른다배경 설명부터 시작해 첫 문장에 답이 없는 단락
③ 인용(출처로 표시되는가)사실·수치·출처·완결성 4가지 기준 심사주장은 있는데 수치와 출처가 없는 단락

AI 인용 점검의 출발점은 점검 단위를 페이지에서 단락으로 바꾸는 것입니다. 단락 하나를 떼어내 세 가지(혼자 읽히는가, 첫 문장이 곧 답인가, 수치와 출처가 붙어 있는가)를 확인하면 그 단락의 인용 가능성을 스스로 진단할 수 있습니다. 같은 기준을 iPullRank는 인용 적격(Citation-Worthy) 프레임, 곧 사실에 근거하고(Factual) 출처를 추적할 수 있으며(Attributable) 검증 가능할 것(Verifiable)으로 정리합니다.

콘텐츠 점검 단위를 페이지에서 단락으로

AI 검색에서 경쟁 단위는 페이지가 아니라 단락입니다. 키워드 순위 리포트는 페이지 단위 성적표지만, AI의 인용은 단락 단위로, 문서 순위와 별개로 결정됩니다. 검색 순위 1위 페이지라도 단락이 선택되지 못하면 AI 답변에는 등장하지 않습니다. 콘텐츠를 점검하는 단위도 '페이지'에서 '단락'으로 바꿔야 합니다.

각 단락은 AI가 만든 확장 질문 하나하나에 대해 "이 질문에 가장 잘 답하는 단락" 자리를 두고 경쟁합니다. AI는 질문 하나를 받으면 뒤에 숨은 확장 질문 수십 개를 만들어 자료를 모으기 때문입니다. 그래서 글을 쓰기 전에 확인할 것은 그 질문 목록입니다. 아무리 잘 쓴 단락도, 목록에 없는 질문의 답이면 선택될 자리가 없습니다.

"What is Custom Corpus in Google AI Mode?"라는 질문을 2026년 8월, Gemini 3 Flash·GPT-5.4·Perplexity Sonar Pro 세 모델에 넣어 확장 질문을 분석했습니다. 생성된 확장 질문 17개 중 11개가 Vertex AI, Google One처럼 이름만 비슷한 구글 제품 질문이었습니다. 이 용어를 제대로 설명한 콘텐츠가 아직 부족해, AI가 비슷한 이름의 제품 쪽으로 흘러간다는 뜻입니다. 이 글이 정의에서 시작해 제품 기능과의 구분까지 다룬 이유입니다. 여러분의 브랜드명과 전문 용어도 마찬가지입니다. AI가 그 단어를 무엇으로 알아듣는지에 따라, 써야 할 글의 구조가 달라집니다.

확장 질문 유형 (iPullRank 분류 기준)개수
Entity-Expanded (개체 확장)7
Reformulation (재구성)4
Related (관련)3
Implicit (암시적)2
Comparative (비교)1
합계 (Gemini 8 · GPT 6 · Perplexity 3)17

확장 질문 17개 분석은 API 모델 기반 시뮬레이션으로, Google 내부 데이터는 아닙니다. 모델과 입력 질문("What is Custom Corpus in Google AI Mode?")을 밝혀 두었으니, 여러분의 주제로도 같은 확인을 해볼 수 있습니다.

자주 묻는 질문 (FAQ)

Q. Custom Corpus는 Vertex AI의 corpus와 같은 것인가요? 아닙니다. Vertex AI의 corpus는 사용자가 구성하는 제품 기능이고, Google AI Mode의 Custom Corpus는 검색 파이프라인이 질문마다 자동으로 구성하는 임시 문서 집합입니다(Google 특허 US2024/0362093A1).

Q. Google AI Mode는 검색 순위 1위 페이지를 우선 인용하나요? 아닙니다. 인용은 문서 순위와 독립적으로 단락 단위에서 결정됩니다. 1위 페이지의 단락도 인용에서 탈락할 수 있고, 순위가 낮은 페이지의 단락이 출처로 표시될 수 있습니다.

Q. Custom Corpus는 매번 새로 만들어지나요? 네. 질문마다 확장 질문 목록이 달라지고, 그 목록으로 구성되는 문서 집합도 달라집니다. 같은 주제라도 질문이 다르면 다른 Custom Corpus가 만들어집니다.

Q. Google AI Mode는 기존 Google 검색과 무엇이 다른가요? 기존 검색은 순위를 매긴 링크 목록을 보여주고, Google AI Mode는 Custom Corpus에서 고른 단락들을 조립한 하나의 답변을 보여줍니다. 경쟁 단위가 페이지 순위에서 단락으로 바뀐 것이 실무에서 가장 큰 차이입니다.

Q. 이 구조는 Google AI Mode에만 해당하나요? 용어와 세부 메커니즘은 Google 특허 기준이지만, 큰 틀은 그렇지 않습니다. 질문을 확장해 재료를 모으고 출처를 단락 단위로 표시하는 방식은 ChatGPT 검색과 Perplexity의 공개된 제품 동작에서도 확인할 수 있습니다.

출처 목록

  1. Google 특허 US2024/0362093A1 (Custom Corpus) — https://patents.google.com/patent/US20240362093A1/en
  2. Google 특허 WO2024064249A1 (Query Fan-Out) — https://patents.google.com/patent/WO2024064249A1/en
  3. Google 특허 US2025/0124067A1 (1:1 비교 심사) — https://patents.google.com/patent/US20250124067A1/en
  4. Google 공식 블로그 "How AI is powering a more helpful Google" (2020-10-15) — https://blog.google/products/search/search-on/
  5. Google "AI Overviews and AI Mode in Search" 공식 PDF — https://search.google/pdf/google-about-AI-overviews-AI-Mode.pdf
  6. iPullRank "How AI Mode Works" (Mike King) — https://ipullrank.com/how-ai-mode-works