INNER CODE UNIT · Python
_load_all
raullenchai/Rapid-MLX · vllm_mlx/models/deepseek_v41_native/server.py:52
def _load_all():
return load_product_runtime(
str(target_path),
str(mtp_path),
target_revision=TARGET_REVISION,
mtp_revision=MTP_REVISION,
mtp_identity=MTP_REPO,
)
model, tokenizer, runtime = _dflash_executor.submit(_load_all).result()
app = _build_app(
model=model,
processor=tokenizer,
runtime=runtime,
served_model_name=served_model_name,
default_max_tokens=default_max_tokens,
cors_origins=cors_origins,
no_thinking=no_thinking,