GitHub - YiY-Xu/multimodal_vtt: Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval

Handle kaldi audio features

install kaldiio : pip install kaldiio
change data source path directory in preprocessing_audio.py
run preprocessing_audio.py

Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval

Code for the video-text retrieval methods from "Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval" (Mithun, Niluthpol C and Li, Juncheng and Metze, Florian and Roy-Chowdhury, Amit K) 2018

Dependencies

This code is written in python. The necessary packages are below:

Python 2.7
PyTorch (>0.3)
Tensorboard
NLTK Punkt Sentence Tokenizer

Evaluate Models

-- Download data and models from https://drive.google.com/drive/folders/1t3MwiCR72HDo6XiPvWSZpenqv4CGjnKl -- To evaluate on MSR-VTT dataset : python test_weighted.py

Reference

If you use our code or models, please cite the following paper:

@inproceedings{mithun2018learning, title={Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval}, author={Mithun, Niluthpol C and Li, Juncheng and Metze, Florian and Roy-Chowdhury, Amit K}, booktitle={ICMR}, year={2018}, organization={ACM} }

--This code is built on top of VSE++(https://github.com/fartashf/vsepp)

-- Contact: Niluthpol Chowdhury Mithun (nmith001@ucr.edu)

Name		Name	Last commit message	Last commit date
Latest commit History 60 Commits
.gitignore		.gitignore
README.md		README.md
__init__.py		__init__.py
compute_text_query.py		compute_text_query.py
data_i3d_audio.py		data_i3d_audio.py
data_resnet.py		data_resnet.py
encode_text.py		encode_text.py
encode_video_clip.py		encode_video_clip.py
evaluation.py		evaluation.py
get_id_list.py		get_id_list.py
how2dataset.py		how2dataset.py
kaldi_source.py		kaldi_source.py
model.py		model.py
preprocessing_audio.py		preprocessing_audio.py
test_weighted.py		test_weighted.py
train_vtt.py		train_vtt.py

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

Handle kaldi audio features

Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval

Dependencies

Evaluate Models

Reference

About

Releases

Packages

Languages

YiY-Xu/multimodal_vtt

Folders and files

Latest commit

History

Repository files navigation

Handle kaldi audio features

Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval

Dependencies

Evaluate Models

Reference

About

Resources

Stars

Watchers

Forks

Releases

Packages 0

Languages

Packages