INNER CODE UNIT · Python

_load_all

raullenchai/Rapid-MLX · vllm_mlx/models/deepseek_v41_native/server.py:52

    def _load_all():
        return load_product_runtime(
            str(target_path),
            str(mtp_path),
            target_revision=TARGET_REVISION,
            mtp_revision=MTP_REVISION,
            mtp_identity=MTP_REPO,
        )

    model, tokenizer, runtime = _dflash_executor.submit(_load_all).result()
    app = _build_app(
        model=model,
        processor=tokenizer,
        runtime=runtime,
        served_model_name=served_model_name,
        default_max_tokens=default_max_tokens,
        cors_origins=cors_origins,
        no_thinking=no_thinking,

View source record →

📰 Research Paper
Loading…
⏳ Fetching content…