오픈웨이트 LLM은 어디에 배포할까: 구독·API·GPUaaS·로컬의 선택 기준
GLM-5.2를 기준으로 구독형, API, GPUaaS·NPUaaS, 로컬 구동을 비용·통제권·보안·운영 난이도 관점에서 비교하고 배포 전환 기준을 정리합니다.
QSike Tech Notes는 반짝 뉴스보다 오래 남는 구조를 봅니다. GPU와 HBM, 데이터센터와 전력, 클라우드 비용, 기업의 AI 도입과 업무 자동화까지 기술 변화의 배경을 차분히 풀어 씁니다.
개별 뉴스보다 오래 참고할 수 있는 구조 설명부터 골랐습니다.
가정과 계산식을 공개하고, 서로 비교할 수 없는 숫자는 기간과 단위를 먼저 맞춥니다.
GLM-5.2를 기준으로 구독형, API, GPUaaS·NPUaaS, 로컬 구동을 비용·통제권·보안·운영 난이도 관점에서 비교하고 배포 전환 기준을 정리합니다.
AX 에이전트가 운영 단계에서 멈추는 이유를 컨텍스트 엔지니어링, 암묵지, 지식 그래프, 온톨로지 관점으로 해설하고 작은 업무 단위의 시작 기준을 정리합니다.
AX가 실험에서 현장 성과로 넘어가려면 중앙 CoE와 현장 FDE형 실행조직을 함께 설계해야 합니다. 역할 경계, 운영 구조, AI 에이전트 실행 기준을 정리합니다.
AX의 성패를 AI Ready Data와 데이터 권한 설계 관점에서 해설합니다. 데이터 계약, RBAC·ABAC 결합, 검색 단계 권한 적용의 실무 기준을 정리합니다.
AX(AI Transformation)를 생성형 AI 도구 도입이 아니라 요청부터 실행·검증·학습까지 이어지는 E2E Workflow 재설계로 바라봅니다. Process Innovation을 AI 시대에 확장하는 전략 프레임과 실무 점검 기준을 정리합니다.
Hermes Agent, OpenClaw, ChatGPT Codex, Claude Code를 기능 목록 대신 일하는 자리로 비교합니다. 자동화 절차, 멀티채널 게이트웨이, 개발 실행, 코드베이스 워크플로의 차이를 정리합니다.
량원펑 딥시크 창립자 인터뷰를 바탕으로, GPU 숫자와 예산 너머의 AI 경쟁력—독창성, 조직 능력, 오픈소스, 추론 효율—을 살펴봅니다.
2026년 7월 샌프란시스코 AI 서밋이 보여준 변화: AI 경쟁은 모델 성능을 넘어 반도체·데이터센터·피지컬 AI·기업 운영을 잇는 공급망 경쟁으로 이동하고 있습니다.
텍스트·음성·이미지 입력은 각각 토큰과 비용이 계산되는 방식이 다릅니다. 업무 자동화에서 입력 형식에 따라 비용·속도·정확도가 어떻게 달라지는지 정리합니다.
프롬프트, 컨텍스트, 하네스, 에이전트 루프로 AI 호출 구조가 복잡해질수록 토큰과 추론 메모리 수요가 어떻게 늘어나는지 설명합니다.
구글과 테슬라의 2분기 실적 발표를 메모리 수요 관점에서 읽습니다. 매출 숫자보다 AI 서비스가 반복 실행될수록 커지는 데이터센터·추론·메모리 계층의 부담을 짚습니다.
OpenAI, Anthropic-AMD, SpaceXAI의 기가와트급 데이터센터 발표가 보여주듯, AI 경쟁은 GPU 확보에서 전력·냉각·메모리 계층 경쟁으로 이동하고 있습니다.