INNER CODE UNIT · Python
build_predict_text
JackHCC/Chinese-Text-Classification-PyTorch · predict.py:37
def build_predict_text(self, texts):
words_lines = []
seq_lens = []
for text in texts:
words_line = []
token = self.tokenizer(text)
seq_len = len(token)
if self.pad_size:
if len(token) < self.pad_size:
token.extend(['<PAD>'] * (self.pad_size - len(token)))
else:
token = token[:self.pad_size]
seq_len = self.pad_size
# word to id
for word in token:
words_line.append(self.vocab.get(word, self.vocab.get('<UNK>')))
words_lines.append(words_line)
seq_lens.append(seq_len)