INNER CODE UNIT · Python

__call__

tensorchord/modelz-llm · src/modelz_llm/emb.py:54

    def __call__(self, req: EmbeddingRequest) -> EmbeddingResponse:
        token_count, embeddings = self.get_embedding_with_token_count(req.input)
        embeddings = embeddings.detach()
        if self.device != "cpu":
            embeddings = embeddings.cpu()
        embeddings = embeddings.numpy()
        if req.encoding_format == "base64":
            embeddings = [
                base64.b64encode(emb.astype(np.float32).tobytes()).decode("utf-8")
                for emb in embeddings
            ]
        else:
            embeddings = [emb.tolist() for emb in embeddings]

        resp = EmbeddingResponse(
            data=[
                EmbeddingData(embedding=emb, index=i)
                for i, emb in enumerate(embeddings)

View source record →

📰 Research Paper
Loading…
⏳ Fetching content…