(보드에서 사용되는 CPU가 ARM core를 사용한다는것을 기준으로 작성된 글입니다.) NPU에서 모델이 동작하고 뱉어내는 tensor의 type에 주목할 필요가 있다.1) NPU에는 quantization(양자화)을 거친 network가 동작한다.2) network가 가진 weight, activation등은 모두 낮은 정밀도로 표현되어있으며 입력으로 들어온 데이터를 처리한다.3) NPU는 대다수 내부에서 int8연산만을 지원한다.4) 따라서 output tensor의 type또한 int8의 형태를 지닌다. 따라서 NPU에서 뱉어내는 output이 결국 network가 뱉어내는 output과 동일하다는 의미이고, 이는 network의 output tensor를 의미한다. tensor의 형태는 어..