INNER CODE UNIT · Python
_prepare_phrase_tokenizer
liyucheng09/Selective_Context · app/app.py:52
def _prepare_phrase_tokenizer(self):
# we use space to tokenize sentence into phrases
# for English, we should use `spacy.load("en_core_web_sm").add_pipe('merge_noun_chunks')`
# for Chinese, use `nlp = spacy.load('zh_core_web_sm')`` directly
lang = self.lang
if lang == "en":
self.nlp = spacy.load("en_core_web_sm", disable=["ner"])
self.nlp.add_pipe('merge_noun_chunks')
elif lang == "zh":
self.nlp = spacy.load('zh_core_web_sm', disable=["ner"])
def _prepare_model(self):
if self.model_type == 'gpt2':
if self.lang == 'zh':
self.model = GPT2LMHeadModel.from_pretrained('uer/gpt2-chinese-cluecorpussmall')
self.tokenizer = BertTokenizer.from_pretrained('uer/gpt2-chinese-cluecorpussmall')
else:
self.model = GPT2LMHeadModel.from_pretrained('gpt2')