안녕하세요, 저는 이번 SKKU NPU Challenge 2026에 참가하여 MLA100 PCIe 카드를 지원받아 연구를 진행하고 있는 학생입니다.
저희 팀은 “Batch Scheduling 최적화를 기반으로 한 추론 가속"을 주제로 프로젝트를 진행하고 있습니다. 이를 위해 여러 LLM Serving 논문들에서 제시한 방법을 코드로 구현해보고 성능을 시험해보고자 하고 있습니다.
프로젝트 진행 및 알고리즘 설계를 위해 모빌린트 깃허브 레포지토리와 docs.mobilint.com 문서를 면밀히 분석해보았으나, 제공되는 파이썬/C++ API 래퍼(Wrapper) 외에 핵심 로직인 qbcompiler 및 qbruntime 의 내부 구현 소스코드는 확인할 수 없었습니다.
이에 따라 이번 챌린지 수행 과정에서 하드웨어 제어 범위에 대해 확인하고자 질문을 남깁니다.
-
내부 코드 수정 및 커스텀 스케줄링 가능 여부: 현재 공개된 소스코드 수준에서는 저희가
qbcompiler나qbruntime내부의 핵심 스케줄러 알고리즘이나 SRAM-External DRAM 간의 정적 메모리 배치 할당 경로를 직접 수정할 수 없는 구조(Closed Source)로 이해됩니다. 혹시 저희가 로우레벨 코드에 대한 자료를 제공받을 수 있을까요? -
만약 내부 코드 공개가 불가하다면, 저희는 모빌린트 SDK가 상위 레이어에 제공하는
BatchParam구조체, 비동기 추론(Async API),Dynamic Batching관련 파라미터 등의 하이레벨 API 제어 및 스케줄링 정책 최적화에만 집중하여 프로젝트를 수행해야 하는지 가이드를 주시면 감사하겠습니다.
대회에 참가할 수 있도록 좋은 하드웨어와 환경을 지원해주셔서 감사드리며, 답변 주신 내용을 바탕으로 연구 설계 방향을 명확히 다듬어 챌린지에서 좋은 성과를 내도록 하겠습니다.
감사합니다.