구형 Ampere기반 A40에 여러 chat, reranker, embedding 등의 모델을 올려 로컬 LLM으로 활용하고 있습니다.(ex: Freaksterz/Qwen3.8-27B-SmoothQuant-W8A8-INT8) vLLM 업데이트, 요청 모니터링, START, STOP 스크립트를 첨부와 같이 만들어 관리하고 있습니다. (클로드 활용)프로파일로 관리가 되므로 신규 모델 실행 시 만들어 주면 이후 재사용 가능합니다. A40에서는 최신 양자화가 H/W 수준에서 지원이 안되어서 INT8 사용, 컨텍스트 길이 제한 등 여러가지를 고려하였으나,다른 GPU 사용 시, 클로드에게 해당 부분으로 맞춰달라하면 수정가능할 것입니다.