AI 인프라 경쟁의 무게중심이 모델 성능에서 서비스 운영 역량으로 옮겨가고 있다. 모델 추론 속도와 효율성을 높이는 기술뿐 아니라 다수의 GPU와 서비스를 안정적으로 운영하는 역량까지 핵심 과제로 확대되면서, AI 인프라 소프트웨어 기업 래블업(대표 신정규)이 이 흐름에 맞춰 해외 고객과 파트너를 대상으로 한 첫 글로벌 웨비나 시리즈 'AI Scale Talks'를 진행하고 마무리했다. 웨비나는 2026년 8월 27일부터 9월 17일까지 매주 한 차례씩 총 4회에 걸쳐 'From Cell to Factory'라는 주제로 열렸다.

개별 추론 기술에서 대규모 운영까지 단계별 구성
4회의 웨비나는 개별 추론 기술에서 대규모 인프라 운영까지 단계별로 이어지는 구성을 취했다. 1회차에서는 래블업이 오픈소스로 공개한 고성능 LLM·VLM 추론 엔진 MLxcel을 소개했다. 2회차에서는 KV 캐싱, 양자화, 투기적 디코딩 등 추론 최적화 기법과 관련 실험 결과를 공유했다.
3회차는 실제 고객사의 AI 인프라 구축·운영 경험을 다뤘다. 마지막 4회차에서는 여러 AI 모델과 서비스 간 요청을 분배하는 Continuum Router와, 여러 라우터의 토큰 사용량·운영 정책·과금을 중앙에서 관리하는 Continuum Hub를 통해 다중 모델 운영 방식을 소개했다.
“글로벌 시장에 기술력과 노하우 알려 나가겠다”
신정규 래블업 대표는 “이번 웨비나는 해외 고객과 파트너를 대상으로 래블업의 AI 인프라 기술과 구축·운영 경험을 직접 소개한 첫 번째 글로벌 웨비나”라고 말했다. 이어 “앞으로도 글로벌 파트너들과 공동 웨비나를 비롯한 기술 교류를 이어가며 래블업의 기술력과 AI 인프라 운영 노하우를 글로벌 시장에 알려 나가겠다”고 밝혔다.
웨비나 영상은 래블업 공식 유튜브 채널의 Lablup Talks 재생목록에서 확인할 수 있다. 래블업은 이번 시리즈를 계기로 해외 고객과 파트너를 대상으로 한 기술 커뮤니케이션을 계속 확대해 나갈 계획이다.