lightrft.datasets.audio_alpaca¶
- class lightrft.datasets.audio_alpaca.AudioAlpacaHandler[source]¶
Bases:
BaseDataHandlerData Handler for Audio Alpaca dataset.
Dataset Repo: https://huggingface.co/datasets/declare-lab/audio-alpaca
- get_media_info(item: Dict[str, Any]) Dict[str, Dict[str, Any]][source]¶
Extract audio bytes info for chosen and rejected audios.
- Parameters:
item (Dict[str, Any]) – A data item from load_data
- Returns:
Dict containing audio bytes for ‘chosen_audio’ and ‘rejected_audio’
- Return type:
Dict[str, Dict[str, Any]]
Example:
info = handler.get_media_info(item)
- load_data(path: str) List[Dict[str, Any]][source]¶
Load and validate Audio Alpaca data from parquet files.
- Parameters:
path (str) – Path to the directory containing parquet files
- Returns:
A list of data items
- Return type:
List[Dict[str, Any]]
Example:
data = handler.load_data("path/to/audio-alpaca")
- parse_item(item: Dict[str, Any], media_content: Dict[str, Any], config: Dict[str, Any]) Tuple[List[Dict], List[Dict], Dict][source]¶
Parse a single Audio Alpaca item into message pairs for ranking.
- Parameters:
item (Dict[str, Any]) – Raw data item from Audio Alpaca dataset.
media_content (Dict[str, Any]) – Loaded audio content with ‘chosen_audio’ and ‘rejected_audio’ keys.
config (Dict[str, Any]) – Configuration dict with task_instruction template.
- Returns:
A tuple of (messages0, messages1, metadata)
- Return type:
Tuple[List[Dict], List[Dict], Dict]
Example:
msg0, msg1, other = handler.parse_item(item, media_content, config)