INNER CODE UNIT · Python
x
huggingface/transformers-bloom-inference · inference_server/server.py:78
x = GenerateRequest(**x)
x.max_new_tokens = get_num_tokens_to_generate(x.max_new_tokens, args.allowed_max_new_tokens)
response, total_time_taken = run_and_log_time(partial(model.generate, request=x))
response.query_id = query_ids.generate_query_id
query_ids.generate_query_id += 1
response.total_time_taken = "{:.2f} secs".format(total_time_taken)
return response.dict(), status.HTTP_200_OK
except Exception:
response = get_exception_response(query_ids.generate_query_id, args.debug)
query_ids.generate_query_id += 1
return response, status.HTTP_500_INTERNAL_SERVER_ERROR
@app.route("/forward/", methods=["POST"])