'MCP가 CLI보다 토큰을 32배 더 먹는다'는 벤치마크, 어디까지 믿어야 하나
MCP 토큰 오버헤드 실측치는 4~32배부터 '호출당 +50토큰'까지 범위가 넓다. 모순처럼 보이는 두 숫자는 서로 다른 도구 구성을 측정한 결과다. 스키마 크기, 세션 길이, 캐싱·필터링 여부라는 세 가지 조건으로 벤치마크를 읽는 법을 정리한다.
QSike Tech Notes는 반짝 뉴스보다 오래 남는 구조를 봅니다. GPU와 HBM, 데이터센터와 전력, 클라우드 비용, 기업의 AI 도입과 업무 자동화까지 기술 변화의 배경을 차분히 풀어 씁니다.
개별 뉴스보다 오래 참고할 수 있는 구조 설명부터 골랐습니다.
가정과 계산식을 공개하고, 서로 비교할 수 없는 숫자는 기간과 단위를 먼저 맞춥니다.
MCP 토큰 오버헤드 실측치는 4~32배부터 '호출당 +50토큰'까지 범위가 넓다. 모순처럼 보이는 두 숫자는 서로 다른 도구 구성을 측정한 결과다. 스키마 크기, 세션 길이, 캐싱·필터링 여부라는 세 가지 조건으로 벤치마크를 읽는 법을 정리한다.
파운드리 웨이퍼 캐파를 늘려도 AI 가속기 출하가 바로 늘지 않는 이유는 첨단 패키징과 테스트 공정이 납기의 관문이기 때문이다. OSAT 자본지출 발표부터 장비 납기, 클린룸 확보, 자격인증까지 걸리는 시간을 따라가며 AI 칩 공급 달력이 실제로 어떻게 정해지는지 살펴본다.
AI 전력 수요 폭증의 진짜 병목은 발전소가 아니라, 제출된 수요 신청을 누가 걸러내느냐로 이동하고 있다. 텍사스의 474GW 신청 조사와 한국 수도권 계통접속 2% 통과율을 같은 프레임으로 읽고, ERCOT 배치 접속 절차와 한국 계통접속 절차를 나란히 비교한다.
KT·SK AX·LG CNS처럼 내부 인력을 FDE로 전환하거나 전담 조직을 신설하는 선언이 잇따른다. 하지만 선언은 직무명을 바꾸는 일이고, 전환은 운영 체제를 바꾸는 일이다. 재교육 설계, 권한 재조정, 평가·인센티브, CoE와의 관계 재정의, 변화 관리라는 다섯 가지 운영 조건이 갖춰지지 않으면 FDE 선언은 간판만 바꾼 파견 인력 운영으로 끝난다.
기업 AI에서 'RAG 정확도가 낮다'는 말 속에는 문서 검색, 관계 탐색, 의미·규칙 정의라는 서로 다른 층의 문제가 섞여 있다. Context·Knowledge Graph·Ontology가 각각 무엇을 해결하는지 구분하고, GraphRAG와 온톨로지를 올려야 하는 업무 조건과 운영 비용의 경계를 제품·기술 구조 관점에서 정리한다.
AX 추진에서 PI 역량을 가진 사람이 AI를 먼저 배워야 하는지, AI 개발자가 PI를 먼저 배워야 하는지 비교합니다. 초기 문제 정의는 PI가 이끌고 운영화·확산은 AI/플랫폼 인력과 짝을 이루는 구조를 정리합니다.
FDE는 현장 업무를 AI 워크플로와 권한·로그·예외 처리 구조로 번역하는 역할입니다. SI, Citizen Developer와의 차이와 양성 방법을 정리합니다.
AI 에이전트가 기업 소프트웨어의 사용자로 확장될 때 필요한 업무 기능, 작업 단위 권한, 승인 흐름, 실행 로그의 설계 기준을 정리합니다.
AI 전환에서 전략·가드레일은 위에서 정하고, 실제 업무 적용과 개선 학습은 현장에서 넓히는 이중 운영체제를 정리합니다.
FP16·BF16 LLM을 INT8·INT4·FP8·NF4로 양자화할 때 무엇이 달라지는지, PTQ·QAT·GPTQ·AWQ·GGUF·bitsandbytes·QLoRA의 차이와 실무 선택 기준을 정리합니다.
GLM-5.2를 기준으로 구독형, API, GPUaaS·NPUaaS, 로컬 구동을 비용·통제권·보안·운영 난이도 관점에서 비교하고 배포 전환 기준을 정리합니다.
AX 에이전트가 운영 단계에서 멈추는 이유를 컨텍스트 엔지니어링, 암묵지, 지식 그래프, 온톨로지 관점으로 해설하고 작은 업무 단위의 시작 기준을 정리합니다.