LanguageBind: multimodal (video/audio/image/depth/thermal) embedding model aligned to text via language-based semantic alignment. Packaged for pip-installability with compatibility patches for modern transformers/torchvision/torchaudio.
Project Links
Meta
Requires Python: >=3.9
Classifiers
languagebind
LanguageBind (ICLR 2024) packaged as a pip-installable library with compatibility patches for modern transformers, torchvision, and torchaudio.
The original LanguageBind repo has no pyproject.toml, so it cannot be installed via pip. This package provides that, plus inline patches for five breaking changes introduced in newer dependency versions.
Installation
pip install languagebind
For video support:
pip install "languagebind[video]"
For audio support:
pip install "languagebind[audio]"
Usage
from languagebind import (
LanguageBindVideo, LanguageBindVideoProcessor, LanguageBindVideoTokenizer,
LanguageBindAudio, LanguageBindAudioProcessor, LanguageBindAudioTokenizer,
LanguageBindImage, LanguageBindImageProcessor, LanguageBindImageTokenizer,
)
Compatibility patches
_expand_mask/clip_loss: removed fromtransformers4.40+, re-implemented inlanguagebind._compattorchaudio.set_audio_backend(): deprecated, guarded withtry/excepttorchvision.transforms._transforms_video: private API fallback to publictorchvision.transformsequivalentsCLIPTokenizer.__init__positional args: changed to keyword args fortransformers4.40+ compatibility
License
MIT — same as the original LanguageBind.
Wheel compatibility matrix
Files in release
Extras:
Dependencies:
einops
(>=0.8.0)
peft
(>=0.11.0)
torch
(>=2.0.0)
transformers
(<5.0.0,>=4.40.0)