안녕하세요.
MLA100 PCIe 카드에서 Embedding model 추론(예: Qwen/Qwen3-Embedding-0.6B)이 가능한지 알고 싶습니다.
Model Zoo에서는 별도 Embedding model을 제공하지 않고 있는 것으로 알고 있는데, qb Compiler로 직접 컴파일 후 추론이 가능한가요?
안녕하세요.
MLA100 PCIe 카드에서 Embedding model 추론(예: Qwen/Qwen3-Embedding-0.6B)이 가능한지 알고 싶습니다.
Model Zoo에서는 별도 Embedding model을 제공하지 않고 있는 것으로 알고 있는데, qb Compiler로 직접 컴파일 후 추론이 가능한가요?
안녕하세요,
모빌린트 AI 솔루션팀 박진만입니다.
Qwen3-Embedding-0.6B의 경우 NPU 상에서 지원되는 연산 범위는 Qwen3-0.6B와 동일하며, 따라서 tutorial의 LLM 파트에 있는 예제를 해당 모델로 바꿔서 수행하셔도 충분히 컴파일이 가능합니다.
컴파일 시 사용한 커맨드는 다음과 같습니다.
python3 download_model.py --repo-id Qwen/Qwen3-Embedding-0.6B # 모델 다운로드 및 embedding layer 추출
python3 generate_calib.py --model-tag Qwen/Qwen3-Embedding-0.6B --tokenizer-path Qwen/Qwen3-Embedding-0.6B # calibration dataset 생성
python generate_mxq.py --model-path Qwen/Qwen3-Embedding-0.6B --calib-data-path ./calibration_data/datas/Qwen-Qwen3-Embedding-0.6B/en/ --save-path Qwen3-Embedding-0.6B.mxq # 모델 컴파일
다만 아직 추론을 위한 모듈이 model zoo에서 제공되고 있지 않은 바, 추론을 위해서는 직접 관련 코드를 작성하셔야 할 것 같습니다. 개인적으로는 model zoo에서 제공되고 있는 Qwen3-0.6B의 wrapper를 참고자료로 하여 codex나 claude에게 변환을 요청하는 것이 작업 시간을 줄일 수 있는 방향으로 보입니다.
혹시 추가로 문의하실 사항 있으면 편하게 댓글이나 다른 포스트 남겨주시기 바랍니다.
감사합니다.