Edit Models filters
Model Tree
Apps
Inference Providers
One-click Deployment
Models
52
Active filters: audio-visual
elix3r/LTX-2.3-22b-AV-LoRA-talking-head
bpiyush/sound-of-water-models
Audio Classification • Updated • 3
bolinlai/CSTS
Updated • 5
openinterx/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 1.43k • 4
JusperLee/Dolphin
Audio-to-Audio • 7.04M • Updated • 930 • 16
Memories-ai/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 13 • 2
matbee/sam-audio-small-onnx
Updated • 9
matbee/sam-audio-large-onnx
Updated • 8
square-zero-labs/sam-audio-small-onnx
Updated
lopho/ltx2-artist-loras
Updated • 3
dnamodel/tsam-viewer-emotions
Video Classification • Updated • 11
oonepieceeyewear/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 9
nvidia/nemotron-labs-audio-visual-flamingo-hf
Video-Text-to-Text • 9B • Updated • 231 • 12
ckoutlis/auvire-lavdf
12.1M • Updated • 9 • 1
ckoutlis/auvire-avdeepfake1m
8.93M • Updated • 9
Vegetabot/AVSQwen-Omni-7B
Image-Text-to-Text • 11B • Updated • 2
Vegetabot/AVSQwen-Omni-3B
Image-Text-to-Text • 6B • Updated • 4
vsro200/models-vsro200
Video-Text-to-Text • Updated
mhussainahmad/averformer-ravdess
Updated • 5
mhussainahmad/averformer-cremad-v4
Updated • 5
mhussainahmad/averformer-ravdess-v4
Updated • 11
mhussainahmad/averformer-meld-v4
Updated • 4
michaelrhs/mr-big-eye-orch-v2
Visual Question Answering • Updated • 9
NJU-LINK/OmniCaptioner-IF-7B
Image-Text-to-Text • 11B • Updated • 54
NJU-LINK/OmniCaptioner-IF-3B
Image-Text-to-Text • 6B • Updated • 9
NiDeYingZiD/BHGap-ckpt
Updated
catnip-ai-tech/MaineCoon
Any-to-Any • Updated • 29
JusperLee/Real-World-AVSE-Baseline-Track1
Audio-to-Audio • 25M • Updated
JusperLee/Real-World-AVSE-Baseline-Track2
Audio-to-Audio • 25M • Updated