data_juicer.ops.mapper.video_audio_speech_emotion_mapper module#

class data_juicer.ops.mapper.video_audio_speech_emotion_mapper.VideoAudioSpeechEmotionMapper(*args, **kwargs)[source]#

Bases: Mapper

Mapper to generate video tags from audio streams extracted by video using the Audio Spectrogram Transformer.

Source: This operator is a part of HumanVBench (CVPR 2026).

__init__(model_dir_emo='FunAudioLLM/SenseVoiceSmall', speech_Emo: str = 'speech_emotion', *args, **kwargs)[source]#

Initialization method.

Parameters:
  • args – extra args

  • kwargs – extra args

process_single(sample, rank=None)[source]#

For sample level, sample –> sample

Parameters:

sample – sample to process

Returns:

processed sample