반복영역 건너뛰기
주메뉴 바로가기
본문 바로가기
제품/서비스
EMS Solution
Features
클라우드 관리
서버관리
데이터베이스 관리
네트워크 관리
트래픽 관리
설비 IoT 관리
무선 AP 관리
교환기 관리
운영자동화
실시간 관리
백업 관리
스토리지 관리
예방 점검
APM Solution
애플리케이션 관리
URL 관리
브라우저 관리
ITSM Solution
서비스데스크
IT 서비스 관리
Big Data Solution
SIEM
AI 인공지능
Dashboard
대시보드
Consulting Service
컨설팅 서비스
고객
레퍼런스
고객FAQ
문의하기
가격
자료실
카탈로그
회사소개
비전·미션
연혁
2016~현재
2000~2015
인증서·수상
투자정보
재무정보
전자공고
IR자료
새소식
공고
보도자료
오시는 길
채용
피플
컬처
공고
FAQ
블로그
열기
메인 페이지로 이동
블로그
기술이야기
블로그
최신이야기
사람이야기
회사이야기
기술이야기
다양한이야기
[브레인저가 알려주는 IT#1] 네트워크 관리, SNMP가 뭔가요?
카프카를 통한 로그 관리 방법
김채욱
2023.09.19
페이스북 공유하기
트위터 공유하기
링크드인 공유하기
블로그 공유하기
메모리 누수 위험있는 FinalReference 참조 분석하기
안녕하세요! 저는 개발4그룹에서 제니우스(Zenius) SIEM의 로그 관리 기능 개발을 담당하고 있는 김채욱 입니다. 제가 하고 있는 일은 실시간으로 대용량 로그 데이터를 수집하여 분석 후, 사용자에게 가치 있는 정보를 시각화하여 보여주는 일입니다.
이번 글에서 다룰 내용은
1) 그동안 로그(Log)에 대해 조사한 것과 2) 최근에 CCDAK 카프카 자격증을 딴 기념으로, 카프카(Kafka)를 이용하여 어떻게 로그 관리를 하는지
에 대해 이야기해 보겠습니다.
PART1. 로그
1. 로그의 표면적 형태
로그(Log)는 기본적으로 시스템의 일련된 동작이나 사건의 기록입니다. 시스템의 일기장과도 같죠. 로그를 통해 특정 시간에 시스템에서 ‘어떤 일’이 일어났는지 파악할 수도 있습니다. 이렇게 로그는 시간에 따른 시스템의 동작을 기록하고, 정보는 순차적으로 저장됩니다.
이처럼
로그의 핵심 개념은 ‘시간’
입니다. 순차적으로 발생된 로그를 통해 시스템의 동작을 이해하며, 일종의 생활기록부 역할을 하죠. 시스템 내에서 어떤 행동이 발생하였고, 어떤 문제가 일어났으며, 유저와의 어떤 교류가 일어났는지 모두 알 수 있습니다.
만약 시간의 개념이 없다면 어떻게 될까요? 발생한 모든 일들이 뒤섞이며, 로그 해석을 하는데 어려움이 생기겠죠.
이처럼 로그를 통해 시스템은 과거의 변화를 추적합니다. 똑같은 상황이 주어지면 항상 같은 결과를 내놓는 ‘결정론적’인 동작을 보장할 수 있죠. 로그의 중요성, 이제 조금 이해가 되실까요?
2. 로그와 카프카의 관계
자, 그렇다면! 로그(Log)와 카프카(Kafka)는 어떤 관계일까요? 우선 카프카는 분산 스트리밍 플랫폼으로서, 실시간으로 대용량의 데이터를 처리하고 전송하는데 탁월한 성능을 자랑합니다. 그 중심에는 바로 ‘로그’라는 개념이 있는데요. 좀 더 자세히 짚고 넘어가 보겠습니다.
3. 카프카에서의 로그 시스템
카프카에서의 로그 시스템은, 단순히 시스템의 에러나 이벤트를 기록하는 것만이 아닙니다. 연속된 데이터 레코드들의 스트림을 의미하며, 이를 ‘토픽(Topic)’이라는 카테고리로 구분하죠. 각 토픽은 다시 *파티션(Partition)으로 나누어, 단일 혹은 여러 서버에 분산 저장됩니다. 이렇게 분산 저장되는 로그 데이터는, 높은 내구성과 가용성을 보장합니다.
*파티션(Partition): 하드디스크를 논리적으로 나눈 구역
4. 카프카가 로그를 사용하는 이유
로그의 순차적인 특성은 카프카의 ‘핵심 아키텍처’와 깊게 연결되어 있습니다. 로그를 사용하면,
데이터의 순서를 보장할 수 있어 대용량의 데이터 스트림을 효율적
으로 처리할 수 있기 때문이죠. 데이터를 ‘영구적’으로 저장할 수 있어,
데이터 손실 위험 또한 크게 줄어
듭니다.
로그를 사용하는 또 다른 이유는 ‘장애 복구’
입니다. 서버가 장애로 인해 중단되었다가 다시 시작되면, 저장된 로그를 이용하여 이전 상태로 복구할 수 있게 되죠. 이는 ‘카프카가 높은 가용성’을 보장하는 데 중요한 요소입니다.
∴
로그 요약
로그는 단순한 시스템 메시지를 넘어 ‘데이터 스트림’의 핵심 요소로 활용됩니다. 카프카와 같은 현대의 데이터 처리 시스템은
로그의 이러한 특성을 극대화하여, 대용량의 실시간 데이터 스트림을 효율적으로 처리
할 수 있는 거죠. 로그의 중요성을 다시 한번 깨닫게 되는 순간이네요!
PART2. 카프카
로그에 이어 에 대해 설명하겠습니다. 들어가기에 앞서 가볍게 ‘구조’부터 알아가 볼까요?
1. 카프카 구조
· 브로커(Broker)
브로커는 *클러스터(Cluster) 안에 구성된 여러 서버 중 각 서버를 의미합니다. 이러한 브로커들은, 레코드 형태인 메시지 데이터의 저장과 검색 및 컨슈머에게 전달하고 관리합니다.
*클러스터(Cluster): 여러 대의 컴퓨터들이 연결되어 하나의 시스템처럼 동작하는 컴퓨터들의 집합
데이터 분배와 중복성도 촉진합니다. 브로커에 문제가 발생하면, 데이터가 여러 브로커에 데이터가 복제되어 데이터 손실이 되지 않죠.
·
프로듀서(Producer)
프로듀서는 토픽에 레코드를 전송 또는 생성하는 *엔터티(Entity)입니다. 카프카 생태계에서 ‘데이터의 진입점’ 역할도 함께 하고 있죠. 레코드가 전송될 토픽 및 파티션도 결정할 수 있습니다.
*엔터티(Entity): 업무에 필요한 정보를 저장하고 관리하는 집합적인 것
·
컨슈머(Consumer)
컨슈머는 토픽에서 레코드를 읽습니다. 하나 이상의 토픽을 구독하고, 브로커로부터 레코드를 소비합니다. 데이터의 출구점을 나타내기도 하며, 프로듀서에 의해 전송된 메시지를 최종적으로 읽히고 처리되도록 합니다.
·
토픽(Topic)
토픽은 프로듀서로부터 전송된 레코드 카테고리입니다. 각 토픽은 파티션으로 나뉘며, 이 파티션은 브로커 간에 복제됩니다.
카프카로 들어오는 데이터를 조직화하고, 분류하는 방법을 제공하기도 합니다. 파티션으로 나눔으로써 카프카는 ‘수평 확장성과 장애 허용성’을 보장합니다.
·
주키퍼(ZooKeeper)
주키퍼는 브로커를 관리하고 조정하는 데 도움을 주는 ‘중앙 관리소’입니다. 클러스터 노드의 상태, 토픽 *메타데이터(Metadata) 등의 상태를 추적합니다.
*메타데이터(Metadata): 데이터에 관한 구조화된 데이터로, 다른 데이터를 설명해 주는 데이터
카프카는 분산 조정을 위해 주키퍼에 의존합니다. 주키퍼는 브로커에 문제가 발생하면, 다른 브로커에 알리고 클러스터 전체에 일관된 데이터를 보장하죠.
∴
카프카 구조 요약
요약한다면 카프카는
1) 복잡하지만 견고한 아키텍처 2) 대규모 스트림 데이터를 실시간으로 처리하는 데 있어 안정적이고 장애 허용성이 있음 3) 고도로 확장 가능한 플랫폼을 제공
으로 정리할 수 있습니다.
이처럼 카프카가 큰 데이터 환경에서 ‘어떻게’ 정보 흐름을 관리하고 최적화하는지 5가지의 구조를 통해 살펴보았습니다. 이제 카프카에 대해 조금 더 명확한 그림이 그려지지 않나요?
2. 컨슈머 그룹과 성능을 위한 탐색
카프카의 가장 주목할 만한 특징 중 하나는
‘컨슈머 그룹의 구현’
입니다. 이는 카프카의 확장성과 성능 잠재력을 이해하는 데 중심적인 개념이죠.
컨슈머 그룹 이해하기
카프카의 핵심은
‘메시지를 생산하고 소비’
하는 것입니다. 그런데 수백만, 심지어 수십억의 메시지가 흐르고 있을 때 어떻게 효율적으로 소비될까요?
여기서 컨슈머 그룹(Consumer Group)이 등장합니다. 컨슈머 그룹은, 하나 또는 그 이상의 컨슈머로 구성되어 하나 또는 여러 토픽에서 메시지를 소비하는데 협력합니다. 그렇다면 왜 효율적인지 알아보겠습니다.
·
로드 밸런싱:
하나의 컨슈머가 모든 메시지를 처리하는 대신, 그룹이 부하를 분산할 수 있습니다. 토픽의 각 파티션은 그룹 내에서 정확히 하나의 컨슈머에 의해 소비됩니다. 이는 메시지가 더 빠르고 효율적으로 처리된다는 것을 보장합니다.
·
장애 허용성:
컨슈머에 문제가 발생하면, 그룹 내의 다른 컨슈머가 그 파티션을 인수하여 메시지 처리에 차질이 없도록 합니다.
·
유연성:
데이터 흐름이 변함에 따라 그룹에서 컨슈머를 쉽게 추가하거나 제거합니다. 이에 따라 증가하거나 감소하는 부하를 처리할 수 있습니다.
여기까지는 최적의 성능을 위한 ‘카프카 튜닝 컨슈머 그룹의 기본 사항’을 다루었으니, 이와 관련된 ‘성능 튜닝 전략’에 대해 알아볼까요?
성능 튜닝 전략
·
파티션 전략:
토픽의 파티션 수는, 얼마나 많은 컨슈머가 활성화되어 메시지를 소비할 수 있는지 영향을 줍니다. 더 많은 파티션은 더 많은 컨슈머가 병렬로 작동할 수 있음을 의미하는 거죠. 그러나 너무 많은 파티션은 *오버헤드를 야기할 수 있습니다.
*오버헤드: 어떤 처리를 하기 위해 간접적인 처리 시간
·
컨슈머 구성:
*fetch.min.bytes 및 *fetch.max.wait.ms와 같은 매개변수를 조정합니다. 그다음 한 번에 얼마나 많은 데이터를 컨슈머가 가져오는지 제어합니다. 이러한 최적화를 통해 브로커에게 요청하는 횟수를 줄이고, 처리량을 높입니다.
*fetch.min.bytes: 한 번에 가져올 수 있는 최소 데이터 사이즈 *fetch.max.wait.ms: 데이터가 최소 크기가 될 때까지 기다릴 시간
·
메시지 배치:
프로듀서는 메시지를 함께 배치하여 처리량을 높일 수 있게 구성됩니다. *batch.size 및 *linger.ms와 같은 매개변수를 조정하여, 대기 시간과 처리량 사이의 균형을 찾을 수 있게 되죠.
*batch.size: 한 번에 모델이 학습하는 데이터 샘플의 개수 *linger.ms: 전송 대기 시간
·
압축:
카프카는 메시지 압축을 지원하여 전송 및 저장되는 데이터의 양을 줄입니다. 이로 인해 전송 속도가 빨라지고 전체 성능이 향상될 수 있습니다.
·
로그 정리 정책:
카프카 토픽은, 설정된 기간 또는 크기 동안 메시지를 유지할 수 있습니다. 보존 정책을 조정하면, 브로커가 저장 공간이 부족해지는 점과 성능이 저하되는 점을 방지할 수 있습니다.
3. 컨슈머 그룹과 성능을 위한 실제 코드 예시
다음 그림과 같은 코드를 보며 조금 더 자세히 살펴보겠습니다. NodeJS 코드 중 일부를 발췌했습니다. 카프카 설치 시에 사용되는 설정 파일 *server.properties에서 파티션의 개수를 CPU 코어 수와 같게 설정하는 코드입니다. 이에 대한 장점들을 쭉 살펴볼까요?
*server.properties: 마인크래프트 서버 옵션을 설정할 수 있는 파일
CPU 코어 수에 파티션 수를 맞추었을 때의 장점
·
최적화된 리소스 활용:
카프카에서는 각 파티션이 읽기와 쓰기를 위한 자체 *I/O(입출력) 스레드를 종종 운영합니다. 사용 가능한 CPU 코어 수와 파티션 수를 일치시키면, 각 코어가 특정 파티션의 I/O 작업을 처리합니다. 이 동시성은 리소스에서 최대의 성능을 추출하는 데 도움 됩니다.
·
최대 병렬 처리:
카프카의 설계 철학은 ‘병렬 데이터 처리’를 중심으로 합니다. 코어 수와 파티션 수 사이의 일치는, 동시에 처리되어 처리량을 높일 수 있습니다.
·
간소화된 용량 계획:
이 접근 방식은, 리소스 계획에 대한 명확한 기준을 제공합니다. 성능 병목이 발생하면 CPU에 *바인딩(Binding)되어 있는지 명확하게 알 수 있습니다. 인프라를 정확하게 조정할 수도 있게 되죠.
*바인딩(Binding): 두 프로그래밍 언어를 이어주는 래퍼 라이브러리
·
오버헤드 감소:
병렬 처리와 오버헤드 사이의 균형은 미묘합니다. 파티션 증가는 병렬 처리를 촉진할 수 있습니다. 하지만 더 많은 주키퍼 부하, 브로커 시작 시간 연장, 리더 선거 빈도 증가와 같은 오버헤드도 가져올 수도 있습니다. 파티션을 CPU 코어에 맞추는 것은 균형을 이룰 수 있게 합니다.
다음은 프로세스 수를 CPU 코어 수만큼 생성하여, 토픽의 파티션 개수와 일치시킨 코드에 대한 장점입니다.
파티션 수와 컨슈머 프로세스 수 일치의 장점
·
최적의 병렬 처리:
카프카 파티션의 각각은 동시에 처리될 수 있습니다. 컨슈머 수가 파티션 수와 일치하면, 각 컨슈머는 특정 파티션에서 메시지를 독립적으로 소비할 수 있게 되죠. 따라서 병렬 처리가 향상됩니다.
·
리소스 효율성:
파티션 수와 컨슈머 수가 일치하면, 각 컨슈머가 처리하는 데이터의 양이 균등하게 분배됩니다. 이로 인해 전체 시스템의 리소스 사용이 균형을 이루게 되죠.
·
탄력성과 확장성:
트래픽이 증가하면, 추가적인 컨슈머를 컨슈머 그룹에 추가하여 처리 능력을 증가시킵니다. 동일한 방식으로 트래픽이 감소하면 컨슈머를 줄여 리소스를 절약할 수 있습니다.
·
고가용성과 오류 회복:
컨슈머 중 하나가 실패하면, 해당 컨슈머가 처리하던 파티션은 다른 컨슈머에게 자동 재분배됩니다. 이를 통해 시스템 내의 다른 컨슈머가 실패한 컨슈머의 작업을 빠르게 인수하여, 메시지 처리가 중단되지 않습니다.
마지막으로 각 프로세스별 컨슈머를 생성해서 토픽에 구독 후, 소비하는 과정을 나타낸 소스코드입니다.
∴
컨슈머 그룹 요약
컨슈머 그룹은 높은 처리량과 장애 허용성 있는 메시지 소비를 제공하는 능력이 핵심입니다. 카프카가 어떤 식으로 운영되는지에 대한 상세한 부분을 이해하고 다양한 매개변수를 신중하게 조정한다면, 어떠한 상황에서도 카프카의 최대 성능을 이끌어낼 수 있습니다!
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
©
참고 자료
· Jay Kreps, “I Hearts Logs”, Confluent
· 위키피디아, “Logging(computing)”
· Confluent, “https://docs.confluent.io/kafka/overview.html”
· Neha Narkhede, Gwen Shapira, Todd Palino, “Kafka: The Definitive Guide”
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
#LOG
#로그
#카프카
#컨슈머
#KAFKA
#SIEM
#제니우스
김채욱
개발4그룹
실시간 대용량 로그 데이터의 수집 및 가공에 관심을 가지고 있습니다. 함께 발전해 나가는 개발을 추구합니다.
필진 글 더보기
목록으로
추천 콘텐츠
이전 슬라이드 보기
LLM Wiki로 프로젝트 지식 관리하기: Obsidian과 AI 에이전트 적용 사례
LLM Wiki로 프로젝트 지식 관리하기: Obsidian과 AI 에이전트 적용 사례
프로젝트가 길어지면 문서도 함께 늘어납니다. 기획서와 기술 조사 자료, 일정표, 설계서가 쌓이고 요구사항도 계속 바뀝니다. 문제는 필요한 문서를 찾는 것보다, 여러 문서 가운데 지금 무엇을 기준으로 봐야 하는지 판단하는 일이었습니다. AI를 개발 업무에 활용하면서 이 문제가 더 분명해졌습니다. 여러 자료를 빠르게 읽고 정리할 수는 있었지만, 과거 문서와 현재 기준이 함께 있으면 어떤 내용을 우선해야 하는지까지 AI가 스스로 알 수는 없었습니다. 이를 정리하기 위해 Andrej Karpathy가 공개한 LLM Wiki 패턴을 프로젝트 문서 관리에 적용했습니다. 원본과 현재 기준을 분리하고, 문서 우선순위와 변경 이력을 관리하면서 Obsidian과 AI 에이전트를 실제 기획·설계 업무에 활용했습니다. 이 글을 통해서 그 과정에서 어떤 구조를 만들고, 실제 업무에 어떻게 적용했는지 소개하려고 합니다. 이 글에서 말하는 LLM Wiki Andrej Karpathy가 제안한 패턴을 프로젝트 환경에 적용한 것입니다. 원본 자료와 LLM이 관리하는 Markdown Wiki를 분리하고, 사람은 자료를 선택하며 Obsidian에서 문서 연결과 변경 결과를 검토합니다. 이 프로젝트에서는 여기에 문서별 우선순위, 대체 관계, 변경 이력과 기획·설계 산출물 연결 규칙을 구체화했습니다. 원형 출처: Andrej Karpathy, “LLM Wiki — A pattern for building personal knowledge bases using LLMs” 01. 프로젝트 문서가 늘어날수록 ‘현재 기준’이 불분명해졌다 프로젝트 자료는 PPT, PDF, Excel, Markdown으로 나뉘어 있었습니다. PPT에는 합의된 방향이, PDF에는 기술 조사 결과가, Excel에는 기능 목록이, Markdown에는 구현 검토가 들어 있었습니다. 어느 한 문서만 읽어서는 전체 범위를 알 수 없었습니다. 기획이 변경될 때마다 서로 다른 기준을 담은 문서가 함께 남았고, 각각의 문서는 당시 결정과 검토 과정을 담고 있었습니다. 과거 문서를 삭제하면 결정의 맥락을 잃고, 그대로 두면 AI가 오래된 내용을 현재 기준으로 사용할 가능성이 생겼습니다. 검색할 수 있다는 것과, 무엇을 현재 기준으로 적용해야 하는지 안다는 것은 다른 문제였습니다. 프로젝트 문서 관리에서 확인한 핵심 문제 그래서 문서를 더 잘 검색하는 것보다 먼저, 원본과 현재 기준을 구분하고 문서 간 우선순위와 대체 관계를 명시하는 방식이 필요했습니다. 이 문제를 해결하기 위한 출발점으로 LLM Wiki의 기본 구조를 프로젝트 환경에 맞게 다시 정리했습니다. 02. LLM Wiki를 프로젝트 문서 관리 구조로 구체화했다 Karpathy의 원형은 Raw Sources, Wiki, Schema를 분리합니다. 이 구조를 그대로 가져오기보다 프로젝트 문서가 실제로 쌓이고 변경되는 방식에 맞춰 역할을 구체화했습니다. 원본은 수정하지 않고 보존하고, 여러 원본을 대조한 현재 기준은 별도의 Wiki로 관리했습니다. Schema의 역할은 프로젝트 운영 규칙과 문서 우선순위로 구체화했습니다. Karpathy의 LLM Wiki 원형을 프로젝트 문서 관리 방식에 맞게 구체화한 구조 raw/에는 기획서와 일정표 같은 원본을 그대로 보존했습니다. wiki/에는 여러 자료에서 공통으로 확인된 사실, 현재 적용할 요구사항, 설계 결정과 제약을 정리했습니다. index.md에는 어디서부터 읽어야 하는지와 문서 우선순위를, log.md에는 무엇이 언제 바뀌었는지를 기록했습니다. 일반 문서 검색과 무엇이 다른가 LLM Wiki가 RAG를 대체하는 것은 아닙니다. 자료가 많아질수록 검색은 여전히 필요합니다. 검색이 ‘관련 문서를 찾는 일’이라면, LLM Wiki는 ‘찾은 문서를 어떤 기준으로 해석하고 재사용할지 유지하는 일’에 가깝습니다. 이렇게 기준을 구조화한 뒤에는 AI와 사람이 각각 어디까지 판단할지 역할을 나누는 과정이 필요했습니다. 03. AI가 판단하고, 사람은 최종 기준을 결정했다 LLM은 raw 자료를 기존 Wiki, 문서 우선순위, 변경 이력과 비교해 어떤 자료를 우선 적용할지 먼저 판단했습니다. 판단 근거가 충분하면 반영안을 제시하고, 기존 기준과 충돌하거나 해석이 불분명하면 ‘어느 문서를 우선할지’, ‘기존 기준을 대체할지’를 구체적인 질문으로 다시 전달했습니다.사람은 그 질문에 답하고 최종 반영 여부를 확인했습니다. LLM은 우선순위를 먼저 판단하고 질문하며, 사람은 답변과 최종 확인을 담당합니다. Karpathy의 원형에서도 LLM Agent와 Obsidian을 나란히 두고, LLM이 Wiki를 수정하는 동안 사람이 결과를 탐색·검토하는 역할 구분을 제안합니다. 이 프로젝트에서는 문서 연결을 통해 기획 기준에서 설계와 화면 문서로 이동하고, 역방향 연결로 한 정책 변경이 어떤 문서에 영향을 주는지 확인했습니다. Graph View는 핵심 문서와 연결되지 않은 문서를 살펴보는 보조 수단으로 사용했습니다. Obsidian Graph View로 확인한 LLM Wiki 연결 구조 기획·요건·설계·구현·검증 문서가 어떤 기준 문서를 중심으로 연결되는지 살펴보고, 연결이 약하거나 고립된 문서를 사람이 점검하는 데 사용한 실제 화면입니다. Graph View 자체가 최신 승인 문서를 판정하는 것은 아닙니다. 내부 검토용 실제 캡처이며, 외부 공개본에서는 프로젝트명과 내부 문서명을 비식별화해야 합니다. 도구가 해결하지 않는 부분 Obsidian은 최신 승인 문서를 자동으로 판별하지 않으며, LLM이 작성한 문서의 정확성을 보장하지도 않습니다. 문서 우선순위, 원본 근거와 사람의 검토가 계속 필요합니다. 이렇게 역할을 나누자 Wiki는 단순한 문서 저장소가 아니라, 변경된 기준을 실제 업무에 다시 적용하기 위한 출발점이 됐습니다. 다음으로 이 구조를 정책 변경과 화면설계에 어떻게 사용했는지 살펴보겠습니다. 04. 실제 설계 업무에서 LLM Wiki를 어떻게 사용했는가 구조를 만든 뒤에는 이 기준이 실제 기획·설계 업무에서도 일관되게 작동하는지 확인했습니다. 여기서는 인증·권한 정책 변경과 화면설계 두 가지 사례를 중심으로 살펴보겠습니다. CASE 01. 정책 변경을 관련 설계 전체에 반영했다 API Key 정책이 바뀌었을 때 인증 문서 하나만 수정하지 않았습니다. 관련 Wiki를 찾아 권한 범위, 상태 모델, 감사 기록, 화면 표시와 개발 책임을 함께 대조했습니다. 변경 이유와 우선 적용 문서를 기록해 구형 설계가 다시 사용되지 않도록 했습니다. 확인한 결과: 한 정책 변경이 상태·감사 모델, 화면과 개발 설계까지 함께 반영됐습니다. CASE 02. Wiki의 기준을 사용자 화면과 개발 설계까지 연결했다 화면설계는 ‘API Key 관리 화면을 만들어 달라’는 한 문장의 지시로 시작하지 않았습니다. 먼저 Wiki 문서 우선순위에서 현재 적용해야 할 기획·인증·권한·보안 기준을 확인하고, 기존 UI 참고 자료와 서로 충돌하는 항목을 대조했습니다. 자료 Ingest → LLM 우선순위 판단 → 충돌·불확실성 질문 → 사용자 답변·확인 → Wiki 반영 → 화면 정책 추출 → 사용자용 HTML → 개발자용 설계 ① 입력 자료와 현재 기준을 분리했다 원본 UI 참고 이미지와 기획 자료는 근거로 보존했습니다. AI 에이전트는 wiki/index.md의 우선순위와 기존 변경 이력을 바탕으로 권한 설계, API Key 보안 정책과 개발 가이드 중 현재 적용할 기준을 먼저 판단했습니다. 과거 문서와 충돌하는 항목은 질문으로 분리했고, 사용자의 답변과 확인을 거쳐 최종 기준과 판단 이유를 변경 이력에 남겼습니다. ② 사용자 관점의 화면 흐름을 HTML로 만들었다 관리 목록, 간편·상세검색, 등록, 재발급, 폐기, 폐기 재확인과 감사 이력 조회를 하나의 화면설계 HTML에 구성했습니다. 이 단계의 목적은 코드를 정하는 것이 아니라 사용자가 어떤 순서로 선택하고 확인하는지를 검토하는 것이었습니다. Wiki의 실제 화면설계 HTML을 렌더링한 화면입니다. 목록에서 전체 흐름을 확인하고, 등록·1회 표시·재발급·폐기·재확인·이력 조회를 함께 검토할 수 있도록 구성했습니다. 계정명, 제품명, Key와 내부 주소는 외부 설명용 값으로 비식별화했습니다. ③ 사용자 검토 결과를 다시 화면에 반영했다 별도 사용자 선택 팝업은 등록 창 내부 Selectbox로 변경했고, 폐기에는 최종 재확인 단계를 추가했습니다. 사용자가 알 필요 없는 내부 Reason Code와 Key ID 검색은 제거했으며, 내부 상태 코드는 표시명으로 바꿨습니다. Key 원문은 발급·재발급 성공 직후 한 번만 표시하도록 제한했습니다. ④ 확정된 화면을 개발 책임 단위로 분해했다 검색, 목록, 행 선택, 등록, 1회 표시, 재발급, 폐기, 재확인과 이력 조회를 포함한 12개 기능 단위에 고유 ID를 부여했습니다. 각 기능마다 사용자 동작, 선행 권한, 업무 처리, 현재 데이터 변경, 감사 기록과 다음 화면을 연결해 개발자가 화면 뒤의 책임까지 확인할 수 있도록 했습니다. 개발자용 화면·구현 설계 결과 사용자 화면을 12개 기능 단위로 나누고, UI 동작에서 권한 확인·업무 처리·데이터 변경·감사 기록·후속 화면으로 이어지는 구조를 정리했습니다. 실제 DB 테이블명과 내부 클래스명은 설명용 표현으로 일반화했습니다. 확인한 결과: 화면 모양만 생성한 것이 아니라, 어떤 기획·보안 기준이 어떤 사용자 동작으로 바뀌었고 그 동작이 어떤 개발 책임으로 이어지는지 한 흐름으로 추적할 수 있는 산출물을 만들었습니다. AI 에이전트로 필요한 기준만 다시 조회했다 AI 에이전트에게 전체 프로젝트를 막연하게 읽도록 맡기지 않았습니다. 먼저 사용자가 지정한 자료만 Ingest 대상으로 한정하고, 원본 보존과 Wiki 갱신 결과를 확인했습니다. 이후 화면설계에 필요한 항목만 질문해 기준 문서·요구사항·보안 제약·미결정 사항으로 나눠 추출하는 방식으로 작업 범위를 줄였습니다. ① Ingest — 지정한 원본을 Wiki의 근거와 현재 기준으로 연결 [입력] 사용자가 명시한 raw 원본 파일 목록 [비교] 기존 Wiki·index 우선순위·변경 이력과 신규 자료 대조 [판단] LLM이 일치·추가·충돌·대체 관계와 적용 우선순위를 잠정 결정 [질문] 근거가 부족하거나 충돌하면 선택지를 포함해 사용자에게 재질문 [확정] 사용자 답변과 확인에 따라 현재 기준·대체 관계 확정 [기록] 관련 Wiki 갱신, index에 우선순위 반영, log에 판단 사유 추가 [검증] 원본 보존, 변경 파일 목록, 미해결 충돌 확인 원본 파일을 복사하는 것만으로 Ingest가 끝난 것으로 보지 않았습니다. Wiki와 연결된 LLM이 신규 raw 자료를 기존 기준과 비교해 우선순위를 먼저 판단하고, 충돌·모호함·근거 부족이 있으면 사용자에게 다시 질문합니다. 사용자의 답변으로 판단을 확정한 뒤 관련 Wiki, 문서 우선순위와 변경 이력을 함께 갱신해야 다음 질의에서도 같은 기준을 사용할 수 있습니다. ② Query — 화면설계에 필요한 데이터만 구조화해 추출 [질문] 현재 우선순위를 적용해 API Key 관리 화면에 필요한 사용자 동작과 보안 제약을 추출한다. [조회 기준] 문서 우선순위 / 권한 설계 / Key 보안 정책 / 개발 가이드 / 변경 이력 [출력 항목] 사용자 동작 / 표시 항목 / 노출 금지 정보 / 권한 조건 / 감사 요건 [근거] 각 항목이 나온 Wiki 문서와 변경 이유 [사람 판단] 문서 간 충돌 / UX 선택 / 최종 승인 필요 항목 이 질의에서는 화면에 필요한 요구사항과 보안·권한 제약을 근거 문서, 변경 이유와 함께 구조화했습니다. AI 에이전트가 결론을 승인한 것이 아니라, 사람이 쟁점과 근거를 같은 형식에서 검토할 수 있도록 정리한 것입니다. ③Screen Design — 조회 결과를 사용자 흐름과 개발 책임으로 변환 구조화한 기준과 기존 UI 참고 자료를 함께 사용해 사용자용 HTML을 만들고, 검토 의견을 다시 반영했습니다. 확정된 화면은 12개 기능 단위로 나눠 사용자 동작에서 권한·업무 처리·데이터 변경·감사 기록으로 이어지는 개발자용 설계서로 확장했습니다. 05. 적용하며 확인한 이점과 남은 과제 적용 과정에서 가장 크게 달라진 점은 문서를 단순히 모아 두는 데서 그치지 않고, 현재 기준과 그 판단 근거를 함께 추적할 수 있게 됐다는 점입니다. AI 에이전트는 신규 raw 자료를 기존 Wiki와 비교해 충돌과 대체 관계를 먼저 드러내고, 확정하기 어려운 내용은 질문으로 돌려줍니다. 사람은 모든 문서를 처음부터 다시 대조하는 대신 쟁점과 근거를 중심으로 판단하면서 최종 통제권을 유지할 수 있었습니다. 변경의 영향 범위도 한 문서 안에 머물지 않았습니다. 하나의 정책 변경을 관련 요구사항, 상태·감사 모델, 사용자 화면과 개발 설계까지 연결해 확인하고, 어느 기준이 왜 바뀌었는지를 변경 이력에 남겼습니다. 이후 다른 AI 에이전트나 새로운 작업 세션에서도 원본 전체를 매번 다시 해석하기보다 같은 현재 기준과 결정 맥락에서 작업을 시작할 수 있는 기반이 마련됐습니다. 다만 이번 적용 결과만으로 생산성이 얼마나 향상됐는지를 수치로 표현하기에는 무리가 있습니다. 실제 효과를 확인하려면 신규 AI 세션에서 맥락을 전달하는 데 걸리는 시간, 현재 기준을 찾는 시간, 설계 변경 누락이나 재작업이 얼마나 줄었는지 등을 지속적으로 확인할 필요가 있습니다. 또한 LLM은 문서 간 충돌을 찾고 판단을 지원할 수 있지만, 최종 기준을 정하는 것은 여전히 사람의 검토와 확인이 필요한 영역입니다. 마치며 Karpathy가 제안한 LLM Wiki 패턴을 프로젝트에 적용하면서 확인한 것은, AI에게 많은 문서를 제공하는 것만으로 프로젝트 맥락이 안정적으로 유지되지는 않는다는 점입니다. 원본과 현재 기준을 분리하고, 무엇을 우선 적용할지와 무엇이 변경됐는지를 함께 관리해야 다음 작업에서도 같은 기준을 이어갈 수 있었습니다. LLM Wiki 자체를 새롭게 제안한 것은 아닙니다. 이번 적용에서는 공개된 원형을 실제 기획·설계 업무에 맞춰 문서 우선순위, 대체 관계, 변경 이력과 사람의 승인 지점까지 구체화했습니다. LLM은 원본 분석과 지식 정리를 지원하고, 사람은 Obsidian에서 결과를 검토하며 최종 결정을 내리는 방식입니다.
2026.09.17
다음 슬라이드 보기