INNER CODE UNIT · Python
vqcode
FoundationVision/Liquid · evaluation/app.py:153
vqcode = vqcode+ len(tokenizer)
text_ids = tokenizer_image_token(prompt, tokenizer, IMAGE_TOKEN_INDEX, return_tensors='pt')
num_images = (text_ids == IMAGE_TOKEN_INDEX).sum()
image_token_indices = [-1] + torch.where(text_ids == IMAGE_TOKEN_INDEX)[0].tolist() + [text_ids.shape[0]]
cur_input_ids = []
for i in range(num_images + 1):
cur_input_ids.append(text_ids[image_token_indices[i]+1:image_token_indices[i+1]])
if i < num_images:
cur_input_ids.append( vqcode )
input_ids = torch.cat(cur_input_ids, dim=0)
# input_embeddings = vqllm.embed_tokens(input_ids)
inputs = {
"input_ids":input_ids.unsqueeze(0).to("cuda:0"),
"max_new_tokens":1024,
"bos_token_id":tokenizer.bos_token_id, # Begin of sequence token
"eos_token_id":tokenizer.eos_token_id, # End of sequence token
"pad_token_id":tokenizer.pad_token_id, # Pad token