Shortcuts

lightrft.datasets.audio_alpaca

class lightrft.datasets.audio_alpaca.AudioAlpacaHandler[source]

Bases: BaseDataHandler

Data Handler for Audio Alpaca dataset.

Dataset Repo: https://huggingface.co/datasets/declare-lab/audio-alpaca

get_media_info(item: Dict[str, Any]) Dict[str, Dict[str, Any]][source]

Extract audio bytes info for chosen and rejected audios.

Parameters:

item (Dict[str, Any]) – A data item from load_data

Returns:

Dict containing audio bytes for ‘chosen_audio’ and ‘rejected_audio’

Return type:

Dict[str, Dict[str, Any]]

Example:

info = handler.get_media_info(item)
load_data(path: str) List[Dict[str, Any]][source]

Load and validate Audio Alpaca data from parquet files.

Parameters:

path (str) – Path to the directory containing parquet files

Returns:

A list of data items

Return type:

List[Dict[str, Any]]

Example:

data = handler.load_data("path/to/audio-alpaca")
parse_item(item: Dict[str, Any], media_content: Dict[str, Any], config: Dict[str, Any]) Tuple[List[Dict], List[Dict], Dict][source]

Parse a single Audio Alpaca item into message pairs for ranking.

Parameters:
  • item (Dict[str, Any]) – Raw data item from Audio Alpaca dataset.

  • media_content (Dict[str, Any]) – Loaded audio content with ‘chosen_audio’ and ‘rejected_audio’ keys.

  • config (Dict[str, Any]) – Configuration dict with task_instruction template.

Returns:

A tuple of (messages0, messages1, metadata)

Return type:

Tuple[List[Dict], List[Dict], Dict]

Example:

msg0, msg1, other = handler.parse_item(item, media_content, config)