INNER CODE UNIT · Python
logits
Koziev/NLP_Datasets · Conversations/Data/tinkoff_model_dialogues_scoring.py:35
logits = model(**inputs).logits
probas = torch.sigmoid(logits).cpu().detach().numpy()
for msg_probas, (idialog, iline) in zip(probas, input_2_idialog):
idialog2result[idialog].append((dialogues[idialog][iline], float(msg_probas[0]), float(msg_probas[1])))
return [lines_probas for idialog, lines_probas in sorted(idialog2result.items(), key=lambda z: z[0])]
if __name__ == '__main__':
proj_dir = os.path.expanduser('~/polygon/chatbot')
# Сколько реплик диалогов максимально обрабатывать в рамках одного пакета.
# ATT: выбирать с учетом того, что токенизация в bert не всегда очевидная, так что просто подобрать эмпирически под gpu
BATCH_SIZE = 10
device = 'cuda'
tokenizer = AutoTokenizer.from_pretrained('tinkoff-ai/response-quality-classifier-base')