OptionalBoundaryA silence gap at least this long is treated as a chapter boundary — the cheapest reliable topic-shift signal in a recording. Default: 4000.
OptionalDefaultModality to stamp on emitted segments when it can't be inferred. Default: 'audio'.
OptionalEmitAlso emit one child segment per speaker turn inside each chapter. Doubles embedding cost, so it is opt-in; enable for panel/interview content where per-speaker retrieval matters. Default: false.
OptionalMaxMaximum wall-clock length of one chapter, in ms. Default: 300000 (5 minutes).
OptionalMaxHard ceiling on tokens per text segment. The base class splits any
oversized segment via TextChunker so no segmenter can exceed it.
Default: 512.
OptionalMinSegments whose text estimates below this many tokens are merged forward into the next segment, preventing a spray of near-empty vectors. Default: 0 (off).
OptionalOverlapOverlap tokens applied when an oversized segment must be split. Default: 10% of max.
Options specific to TranscriptSegmenter.