{ "context_recp": 7, "conv_delay": 9, "decoder_layers": 2, "encoder_conv_cache_len": 15, "encoder_dim": 256, "encoder_layers": 4, "feat_type": "logmel23_cummn", "frame_hz": 10.0, "full_output_dim": 12, "head_dim": 64, "hop_length": 80, "input_dim": 345, "input_names": [ "frame", "enc_ret_kv", "enc_ret_scale", "enc_conv_cache", "dec_ret_kv", "dec_ret_scale", "top_buffer", "ingest", "decode" ], "key_dim": 64, "max_nspks": 12, "max_speakers": 10, "n_fft": 1024, "n_mels": 23, "num_heads": 4, "onnx_opset_version": 17, "output_names": [ "full_logits", "enc_ret_kv_out", "enc_ret_scale_out", "enc_conv_cache_out", "dec_ret_kv_out", "dec_ret_scale_out", "top_buffer_out" ], "real_output_dim": 10, "sample_rate": 8000, "state_shapes": { "dec_ret_kv": [ 2, 12, 4, 64, 64 ], "dec_ret_scale": [ 2, 12, 4 ], "enc_conv_cache": [ 4, 1, 15, 256 ], "enc_ret_kv": [ 4, 1, 4, 64, 64 ], "enc_ret_scale": [ 4, 1, 4 ], "top_buffer": [ 1, 19, 256 ] }, "subsampling": 10, "target_sample_rate": 8000, "top_buffer_len": 19, "win_length": 200 }