Slackbot
08/21/2023, 9:11 PMJian Shen Yap
08/21/2023, 9:15 PMAaron Pham
08/21/2023, 9:16 PM--workers-per-resource. Note that by default openllm has a custom strategies and will only create 1 runner instance at all timeAaron Pham
08/21/2023, 9:17 PMbentoml.transformers runners. It is designed for specific model architectureYilun Zhang
08/22/2023, 1:33 PMAaron Pham
08/22/2023, 2:34 PMYilun Zhang
08/22/2023, 2:35 PMAaron Pham
08/22/2023, 2:37 PMAaron Pham
08/22/2023, 2:38 PMopenllm.Runner in this instance
runner = openllm.Runner("llama", model_id="meta-llama/Llama-2-7b-chat-hf")
Then in the config, this runner can be set with
runners:
llm-llama-runner:
resources:
<http://nvidia.com/gpu|nvidia.com/gpu>: [0]Aaron Pham
08/22/2023, 2:38 PMYilun Zhang
08/22/2023, 2:39 PMAaron Pham
08/22/2023, 2:39 PMAaron Pham
08/22/2023, 2:40 PMAaron Pham
08/22/2023, 2:40 PMAaron Pham
08/22/2023, 2:40 PMYilun Zhang
08/22/2023, 2:41 PMAaron Pham
08/22/2023, 2:41 PMYilun Zhang
08/22/2023, 3:00 PMAaron Pham
08/22/2023, 3:00 PM