INNER CODE UNIT · Python
num_images
FoundationVision/Liquid · evaluation/app.py:156
num_images = (text_ids == IMAGE_TOKEN_INDEX).sum()
image_token_indices = [-1] + torch.where(text_ids == IMAGE_TOKEN_INDEX)[0].tolist() + [text_ids.shape[0]]
cur_input_ids = []
for i in range(num_images + 1):
cur_input_ids.append(text_ids[image_token_indices[i]+1:image_token_indices[i+1]])
if i < num_images:
cur_input_ids.append( vqcode )
input_ids = torch.cat(cur_input_ids, dim=0)
# input_embeddings = vqllm.embed_tokens(input_ids)
inputs = {
"input_ids":input_ids.unsqueeze(0).to("cuda:0"),
"max_new_tokens":1024,
"bos_token_id":tokenizer.bos_token_id, # Begin of sequence token
"eos_token_id":tokenizer.eos_token_id, # End of sequence token
"pad_token_id":tokenizer.pad_token_id, # Pad token
}
streamer = TextIteratorStreamer(tokenizer, **{"skip_special_tokens": False, "skip_prompt": True})