Required prerequisites
Questions
#179 (comment)
我们使用janus想要进行sft的过程中,需要先运行supervised_tokenize.sh,然后在运行janus_sft.sh,但我观察到supervised_tokenize.sh这个脚本是基于text2image任务进行tokenize的,但是如果我想利用数据集(如下)进行微调的时候,这是否还有效?我看到我们format_dataset.py文件中有着很多的数据集格式化方法,是否会比supervised_tokenize.sh更加有效?如果使用的话,需要协同修改哪里呢?
(这是ShareGPT4V数据集)
Required prerequisites
Questions
#179 (comment)
我们使用janus想要进行sft的过程中,需要先运行supervised_tokenize.sh,然后在运行janus_sft.sh,但我观察到supervised_tokenize.sh这个脚本是基于text2image任务进行tokenize的,但是如果我想利用数据集(如下)进行微调的时候,这是否还有效?我看到我们format_dataset.py文件中有着很多的数据集格式化方法,是否会比supervised_tokenize.sh更加有效?如果使用的话,需要协同修改哪里呢?