사람은 표의 위치와 색, 화살표를 함께 보고 의미를 연결하지만 PDF 내부에는 그 관계가 데이터 구조로 남지 않을 수 있습니다. 화면에서는 한 표처럼 보여도 추출하면 제목, 값, 주석이 서로 다른 순서로 나타나는 이유입니다.
PDF의 읽기 순서는 화면 순서와 다를 수 있습니다
다단 편집, 떠 있는 텍스트 상자, 이미지로 삽입된 표는 사람이 보는 순서와 파일 내부 순서가 다를 수 있습니다. 제목이 다음 페이지 값과 연결되거나 각주가 본문 중간에 들어가면 AI도 잘못된 맥락으로 묶을 가능성이 생깁니다.
스캔 이미지처럼 실제 텍스트가 없는 페이지는 문자 인식 과정도 필요합니다. 작은 글자와 낮은 대비는 여기서 추가 오류를 만듭니다.
표에는 값보다 관계가 더 중요합니다
표를 이해하려면 행과 열의 제목, 단위, 기간, 분모, 예외 조건을 함께 알아야 합니다. 숫자만 추출하면 어느 항목과 연결되는지 알기 어렵습니다. 병합 셀이나 색상 범례에만 뜻을 담은 표도 같은 문제를 만듭니다.
차트 역시 축의 시작점, 비교 기간, 데이터 출처가 빠지면 모양은 읽어도 의미를 잘못 설명할 수 있습니다.
AI가 읽기 쉬운 문서는 어떻게 준비하나요?
- 제목 계층을 실제 문서 구조와 맞춘다
- 표의 행·열 제목과 단위를 텍스트로 남긴다
- 차트의 핵심 관계를 짧은 설명문으로 덧붙인다
- 이미지에만 있는 중요한 수치를 본문에서도 확인할 수 있게 한다
- 페이지마다 출처와 기준 시점을 기록한다
- 공개 전 질문 목록으로 원문과 답변을 대조한다
Feat AI는 PDF, 데이터, 웹페이지를 AI가 이해하고 인용하기 쉬운 형태로 구조화하는 방향을 공개적으로 설명합니다. 다만 특정 정확도나 비용 절감 수치는 원본 실험 자료가 확인되지 않았으므로 이 글의 근거로 사용하지 않습니다.
구조화는 정답 보장이 아닙니다
문서 구조를 개선해도 AI 답변이 항상 정확하거나 특정 서비스에 반드시 인용되는 것은 아닙니다. 구조화는 출처와 맥락을 더 분명히 전달하는 준비 과정입니다. 중요한 수치와 결론은 원문 링크, 작성자 검토, 별도의 사실 확인 절차와 함께 운영해야 합니다.