- 사내 문서를 500~1,000 토큰 단위로 나누고 한 문서에 하나의 주제만 담아야 합니다.
- 표와 이미지에는 텍스트 설명을 곁들이고 문서 제목은 질문과 답변 형태로 작성합니다.
- 정확한 답변을 생성하려면 메타데이터로 최신성을 관리하고 RAG 구조를 활용해야 합니다.
사내 위키나 업무 매뉴얼을 AI 문서 분석 시스템에 그대로 적용하면 엉뚱한 답변이 나오기 쉬워요. 단순히 업로드하는 것만으로는 복잡한 규정을 정확히 파악하지 못하기 때문입니다. 인공지능이 정확한 답변을 내놓게 만들려면 시스템이 읽고 검색하기 좋은 형태로 지식을 먼저 다듬어야 해요.
문서를 통째로 넣지 않는 이유 🚫
사내 위키나 PDF 매뉴얼을 인공지능에 통째로 학습시키면 원하는 결과를 얻기 어려워요. 방대한 자료 안에는 여러 업무 절차와 규정이 섞여 있기 때문입니다. 200페이지가 넘는 PDF 전체를 한 번에 입력하면, 질문에 맞는 정확한 근거를 찾는 데 어려움을 겪게 돼요.
- 방대한 매뉴얼을 통째로 업로드하면 관련 없는 내용이 섞여 검색 정확도가 떨어집니다.
- 의미가 훼손되지 않는 적절한 단위로 문서를 분할하여 관리하는 것이 중요해요.
따라서 사내 문서를 시스템에 연결할 때는 파일을 그대로 업로드하는 방식을 피해야 합니다. 대신, 시스템이 문맥을 유지하며 읽을 수 있도록 500~1,000 토큰 단위로 문서를 분할해 보세요. 이렇게 나눈 문서 조각들은 검색 단계에서 의미를 비교하는 기본 단위가 됩니다. 문서를 잘게 쪼개어 관리하면, 가장 관련성 높은 조각만 빠르게 찾아내어 답변의 정확도를 높일 수 있어요.
한 문서 한 주제로 다시 나누기 ✂️
문서를 적절한 크기로 나누는 것만큼 내용의 구조화도 중요합니다. 한 문서에는 반드시 하나의 주제만 담아야 해요. 연차 신청, 출장비 정산 등 여러 업무가 한 페이지에 섞여 있으면 검색 품질이 떨어집니다. 시스템은 하나의 주제만 다루는 짧고 명확한 문서를 훨씬 잘 찾아내요.
| 구분 | 내용 | 확인사항 |
|---|---|---|
| 문서 단위 | 한 문서 한 주제 | 여러 업무 혼재 방지 |
| 분할 기준 | 의미가 유지되는 문단 | 500~800 토큰 추가 분할 |
| 우선 적용 | 자주 들어오는 질문 | 반복 질문 영역부터 시작 |
기존의 방대한 문서를 업무 질문과 일대일로 대응되는 개별 페이지로 분리해 보세요. 의미가 유지되는 문단이나 섹션 단위로 나누고, 헤딩 기준으로 나눈 섹션이 너무 길다면 500~800 토큰 정도로 추가 분할하는 것이 좋습니다. 빠르게 도입하고 싶다면, 자주 들어오는 질문 10~20개를 먼저 선별해 주제별로 문서를 나누는 것부터 시작해 보세요.
제목·절차·표를 AI 친화적으로 쓰기 📝
문서의 내용을 명확하게 전달하려면 작성 방식도 인공지능 친화적으로 바꾸어야 해요. 문서의 제목은 내용을 직관적으로 알 수 있게 질문과 답변 형태로 적는 것이 좋습니다. 본문을 작성할 때는 일관된 용어를 사용하고, 절차를 설명할 때는 번호를 매겨 순서를 명확히 구분해 보세요.
- 문서 제목은 구체적인 질문과 답변 형태로 작성하세요.
- 업무 절차를 설명할 때는 번호를 매겨 순서를 명확히 구분하는 것이 좋아요.
표나 이미지를 활용할 때도 주의가 필요합니다. 시스템은 복잡하게 병합된 표나 이미지만 있는 자료를 제대로 읽지 못해요. 표를 넣을 때는 내용을 문장으로 풀어쓴 설명을 곁들여야 합니다. 결재 규정을 표로 만들었다면, "팀장은 최대 100만 원까지 결재할 수 있다"처럼 글로 쓴 설명을 추가하세요. 이미지 역시 그림만 넣지 말고 텍스트로 풀어 설명해야 해요.
버전과 메타데이터로 최신 문서 찾기 🏷️
사내 규정은 수시로 바뀝니다. 과거 규정과 최신 규정이 섞여 있으면 엉뚱한 답변이 나올 수 있으므로, 최신성을 유지하는 장치가 필수예요. 문서마다 버전, 작성일, 개정일, 적용 대상 부서 같은 메타데이터를 꼼꼼히 기록하세요. 작성일을 2026-07-01로, 버전을 3.1이나 2026.2 등으로 명확히 표시해 두는 방식입니다.
- 작성일: 2026-07-01
- 버전: 3.1 또는 2026.2
이러한 메타데이터는 시스템이 문서를 검색할 때 중요한 기준표 역할을 해요. 질문이 들어왔을 때 메타데이터를 확인하여 폐기된 문서나 과거 버전을 검색 결과에서 걸러냅니다. 특정 부서에만 적용되는 지침인지도 메타데이터를 통해 구분할 수 있어요. 문서를 업데이트할 때는 관련 메타데이터도 함께 수정하여 최신 상태를 유지해 보세요.
RAG로 질문과 문서를 연결하기 🔗
잘 정리된 문서를 바탕으로 정확한 답변을 제공하려면 RAG 구조를 활용해야 해요. 사용자의 질문이 들어오면 미리 저장해 둔 사내 문서 조각들을 검색한 뒤, 그 내용을 근거로 답변을 생성하는 방식입니다. 문서를 통째로 모델에 학습시키는 대신 필요할 때마다 관련 정보를 찾아 활용해요.
이 과정은 질문과 문서 조각을 벡터로 변환하는 임베딩 작업에서 시작됩니다. 질문이 입력되면 벡터 검색을 통해 가장 의미가 가까운 문서 조각들을 조회해요. 이후 검색된 문서의 내용을 모델에 전달하여 최종 답변을 만들어냅니다. 이때 문서에 없는 내용은 추측하여 지어내지 않도록 설정해야 합니다. RAG 방식을 도입하면 자주 바뀌는 규정을 즉각적으로 반영할 수 있어요.
출처와 권한을 포함한 운영 체크리스트 ✅
시스템을 안정적으로 운영하려면 출처 표시와 권한 관리를 꼼꼼히 챙겨야 해요. 답변의 신뢰도를 높이기 위해 근거가 된 문서명과 섹션 링크를 반드시 출처로 표시하도록 설정하세요. 사용자가 원본 위키 페이지로 이동하여 내용을 직접 검증할 수 있어야 합니다. 문서에 기반하지 않은 내용은 근거 부족으로 응답하게 만드세요.
| 구분 | 내용 | 확인사항 |
|---|---|---|
| 출처 표시 | 문서명 및 섹션 링크 제공 | 원본 위키 이동 가능 여부 |
| 권한 관리 | 원본 접근 권한 동일 적용 | 권한 밖 문서 검색 제외 |
| 품질 개선 | 오류 로그 기록 및 분석 | 부족한 근거 새 페이지 추가 |
권한 관리 역시 핵심 점검 사항입니다. 원본 위키 시스템에 설정된 접근 권한을 검색 단계에서도 동일하게 적용해야 해요. 열람 권한이 없는 문서는 검색 결과에서 제외되도록 통제하세요. 또한, 시스템 운영 중에는 오류 로그를 기록하여 정기적으로 분석하는 것이 좋습니다. 부족한 근거를 발견하면 새 페이지를 추가하며 지속적인 업데이트를 진행해 보세요.