INNER CODE UNIT · Python
num_batches
sanchit-gandhi/whisper-jax · app/app.py:99
num_batches = math.ceil(num_samples / BATCH_SIZE)
dummy_batches = list(
range(num_batches)
) # Gradio progress bar not compatible with generator, see https://github.com/gradio-app/gradio/issues/3841
dataloader = pipeline.preprocess_batch(inputs, chunk_length_s=CHUNK_LENGTH_S, batch_size=BATCH_SIZE)
progress(0, desc="Pre-processing audio file...")
logger.info("pre-processing audio file...")
dataloader = pool.map(identity, dataloader)
logger.info("done post-processing")
model_outputs = []
start_time = time.time()
logger.info("transcribing...")
# iterate over our chunked audio samples - always predict timestamps to reduce hallucinations
for batch, _ in zip(dataloader, progress.tqdm(dummy_batches, desc="Transcribing...")):
model_outputs.append(pipeline.forward(batch, batch_size=BATCH_SIZE, task=task, return_timestamps=True))
runtime = time.time() - start_time