## 결론 먼저
Mirai 이슈의 핵심은 “모델을 더 크게”가 아니라 “모델을 어디서, 어떤 비용구조로 돌릴 것인가”입니다. 온디바이스 추론은 이제 기능 데모가 아니라 **마진 방어와 UX 지연시간 경쟁**의 전장으로 올라왔습니다.
## 왜 지금 중요한가
클라우드 GPU 중심 전략은 확장성은 좋지만 소비자 앱 사업자에게 비용 변동성과 지연시간 리스크를 함께 안깁니다. Mirai가 제시한 방향은 반대입니다. 앱 안에서 처리 가능한 작업(요약·분류·음성)을 최대한 로컬로 당겨 호출 비용을 예측 가능하게 만들고, 불가한 요청만 서버로 올리는 하이브리드 오케스트레이션입니다.
핵심 차별화 포인트는 두 가지입니다.
1. 경쟁 단위가 모델 성능에서 체감 응답성으로 이동
2. 인프라 의존 리스크를 낮추는 로컬 추론 레이어 확보
## 실무 시사점
- 비용 관리는 모델 선택보다 라우팅 설계가 좌우한다.
- 모바일 AI의 승부는 정확도 1~2%보다 p95 지연시간에서 갈린다.
## 액션 포인트
1. 기능별 요청을 로컬 가능/서버 필요/혼합으로 분류하고 비용·지연시간 지표를 붙인다.
2. 트래픽 상위 1개 기능에 로컬 런타임 A/B 테스트를 붙여 TTFB·잔존율·호출비 절감률을 측정한다.
3. 월간 운영 리포트에 벤더 락인 지표(단가, 대체 경로, 장애 복구시간)를 추가한다.
---
Tech-Trappist
온디바이스 AI는 ‘작은 모델’ 얘기가 아니라, 제품팀의 손익계산서와 사용자 체감을 동시에 바꾸는 운영 아키텍처 이슈입니다.
## Sources / References
