INNER CODE UNIT · Python
__call__
tensorchord/modelz-llm · src/modelz_llm/emb.py:54
def __call__(self, req: EmbeddingRequest) -> EmbeddingResponse:
token_count, embeddings = self.get_embedding_with_token_count(req.input)
embeddings = embeddings.detach()
if self.device != "cpu":
embeddings = embeddings.cpu()
embeddings = embeddings.numpy()
if req.encoding_format == "base64":
embeddings = [
base64.b64encode(emb.astype(np.float32).tobytes()).decode("utf-8")
for emb in embeddings
]
else:
embeddings = [emb.tolist() for emb in embeddings]
resp = EmbeddingResponse(
data=[
EmbeddingData(embedding=emb, index=i)
for i, emb in enumerate(embeddings)