현재 Jetson AGX Orin + ARIES NPU 이종 환경에서 로봇 VLA 모델(NVIDIA GR00T)의 VLM 백본을 NPU로 오프로드하여 연구를 진행하려고 합니다. Mobilint model zoo에서 제공하는 Qwen3-VL-2B MXQ 모델로 성능 측정은 진행하였고, 다음 단계로 실제 VLA 백본인 Cosmos-Reason2-2B를 ARIES에서 실행하기 위해 아래 사양의 커스텀 컴파일이 필요한 상황입니다.
-
대상 모델: nvidia/Cosmos-Reason2-2B (HuggingFace 공개, 아키텍처는 기존 Qwen3-VL 2B과 동일하며 가중치만 상이)
-
출력 사양: 텍스트 생성용이 아닌 인코더 용도로, 전체 레이어 + logits 출력이 아니라 16번째 레이어까지만 실행하고 해당 레이어의 hidden state를 출력으로 받아야 합니다. (VLA의 System2(VLM)가 최종 logits가 아닌 중간 hidden state를 사용하기 때문입니다)
이와 관련하여 아래 사항을 여쭙고자 합니다.
- 위와 같은 커스텀 컴파일(HuggingFace 모델 + 중간 레이어 hidden state 출력)을 할 수 있는 방법이 있을까요?
바쁘시겠지만 확인 후 답변 주시면 감사드리겠습니다.
감사합니다