INNER CODE UNIT · Python
input_embeddings_avg
HIT-SCIR/Chinese-Mixtral-8x7B · train.py:95
input_embeddings_avg = input_embeddings[:-num_new_tokens].mean(dim=0, keepdim=True)
output_embeddings_avg = output_embeddings[:-num_new_tokens].mean(dim=0, keepdim=True)
input_embeddings[-num_new_tokens:] = input_embeddings_avg
output_embeddings[-num_new_tokens:] = output_embeddings_avg
def build_dataset(train_datasets: List[str], valid_datasets: List[str]):
with open("./data/datasets.toml", "rb") as f:
ds_info = tomli.load(f)
train_data_name2ratio = parse_dataset_name_and_ratio(train_datasets) # {"wudao": 0.1, "slimpajama": 0.2}
train_data_name2pathNratio = {} # {"wudao": ("/path/to/wudao", 0.1), "slimpajama": ("/path/to/slimpajama", 0.2)}
for ds_name, ratio in train_data_name2ratio.items():
ds = ds_info[ds_name]
assert "train" in ds["splits"]
train_data_name2pathNratio[ds_name] = (ds["root"].format(DATA_DIR="./data", name=ds_name) + "/" +
ds["encoded"].format(name=ds_name, split="train"),