Vlm 모델 컴파일 관련 문의

현재 Jetson AGX Orin + ARIES NPU 이종 환경에서 로봇 VLA 모델(NVIDIA GR00T)의 VLM 백본을 NPU로 오프로드하여 연구를 진행하려고 합니다. Mobilint model zoo에서 제공하는 Qwen3-VL-2B MXQ 모델로 성능 측정은 진행하였고, 다음 단계로 실제 VLA 백본인 Cosmos-Reason2-2B를 ARIES에서 실행하기 위해 아래 사양의 커스텀 컴파일이 필요한 상황입니다.

  • 대상 모델: nvidia/Cosmos-Reason2-2B (HuggingFace 공개, 아키텍처는 기존 Qwen3-VL 2B과 동일하며 가중치만 상이)

  • 출력 사양: 텍스트 생성용이 아닌 인코더 용도로, 전체 레이어 + logits 출력이 아니라 16번째 레이어까지만 실행하고 해당 레이어의 hidden state를 출력으로 받아야 합니다. (VLA의 System2(VLM)가 최종 logits가 아닌 중간 hidden state를 사용하기 때문입니다)

이와 관련하여 아래 사항을 여쭙고자 합니다.

  1. 위와 같은 커스텀 컴파일(HuggingFace 모델 + 중간 레이어 hidden state 출력)을 할 수 있는 방법이 있을까요?

바쁘시겠지만 확인 후 답변 주시면 감사드리겠습니다.

감사합니다

SuhMinJae님 안녕하세요? 모빌린트 임범수입니다.

말씀하신대로 기존 모델과 다른 input/output 지정을 하기 위해서는 별개의 Parsing Script가 필요합니다.
관련해서 내부 엔지니어에게 예시 파싱 코드를 요청 드려 여기에 공유 드립니다.

mblt_compile_hidden_state.zip (4.7 KB)

해당 파일은 mblt SDK tutorial의 코드를 함께 사용하기 때문에 import 경로가 맞도록 배치해서 사용 부탁 드립니다.
감사합니다.

임범수 드림

1 Like