LLM은 똑똑한데, 왜 우리 회사 일은 모를까
김병균 · 토스 · 토스 기술 블로그
소개
문서 · 코드 · 사내 메신저에 흩어진 정보를, 믿고 쓸 수 있는 컨텍스트로 만드는 여정
AI 핵심 요약
사내 정보가 문서·코드·메신저에 흩어져 있고 서로 최신성이나 내용이 다를 수 있어, 검색 결과만으로는 LLM 답변의 신뢰성을 보장하기 어려웠다. 이를 해결하기 위해 Topic은 출처별 의미 단위로 원문을 수집해 공통 ContentUnit으로 정규화하고, 개념·관계·근거·검증 상태를 연결하는 컨텍스트 계층을 만들었다. 신뢰성을 세우는 기준을 세분화하고, 해시와 규칙 기반 검사 및 의미 검증을 조합하며, 모호한 별칭이나 중요한 충돌은 사람의 판단에 맡긴다. 그 결과 에이전트는 단순 검색 조각 대신 출처와 최신성, 충돌 여부, 근거 부족 상태까지 확인할 수 있으며, 불확실성을 숨기지 않는 것이 신뢰 가능한 답변의 출발점이라는 교훈을 얻었다.
- 문서는 제목 계층, 메신저는 스레드, 코드는 심볼과 동작 단위로 나누면 출처별 의미와 근거를 보존할 수 있다.
- 신뢰도를 하나의 점수로 뭉치기보다 세분화해 문제 유형에 맞는 검증 방법을 적용한다.
- 해시와 원문 위치로 변경을 먼저 감지하고, 내용이 달라진 경우에만 의미 검증을 수행하면 불필요한 재처리를 줄일 수 있다.
- 모호한 사내 별칭은 자동 병합하지 말고 근거를 붙인 후보로 제시해 사람의 승인을 받는다.
- 근거가 부족하거나 출처끼리 충돌하면 임의로 결론 내리지 말고, 불확실성과 충돌 상태를 사용자에게 드러낸다.
비슷한 학습 자료
[팀네이버 컨퍼런스 DAN25] 검색 서비스에 최적화된 LLM 만들기: 데이터, 학습, 서비스 적용 사례
DAN 2025 · YouTube
LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
김민규 · 토스 기술 블로그
LLM을 이용한 서비스 취약점 분석 자동화 #2
표상영 · 토스 기술 블로그
LLM을 이용한 서비스 취약점 분석 자동화 #1
표상영 · 토스 기술 블로그
AI에게 도메인을 가르치다 두 번 갈아엎은 이야기 — LLM Wiki + RAG 혼합기
김태훈 · 컬리 기술 블로그
LLM Application 구축 도전기 (feat. 소중한 고객님들의 리뷰) - 1부
박재현 · 컬리 기술 블로그