@@ -172,14 +172,27 @@ def get_dataset_ner_single(data_name: str = 'wnut2017',
172172 files_info = {'train' : 'train.txt' , 'valid' : 'dev.txt' , 'test' : 'test.txt' }
173173 if not os .path .exists (data_path ):
174174 os .makedirs (data_path , exist_ok = True )
175- os .system ('wget -O {0}/data.tar.gz https://github.com/swiseman /neighbor-tagging/raw /master/data.tar.gz' .
175+ os .system ('wget -O {0}/data.tar.gz https://github.com/asahi417 /neighbor-tagging/blob /master/data.tar.gz' .
176176 format (CACHE_DIR ))
177177 os .system ('tar -xzf {0}/data.tar.gz -C {0}' .format (CACHE_DIR ))
178178 for i in ['train' , 'dev' , 'test' ]:
179179 conll_formatting (
180180 file_token = os .path .join (CACHE_DIR , 'data/conll2003/conll2003-{}.words' .format (i )),
181181 file_tag = os .path .join (CACHE_DIR , 'data/conll2003/conll2003-{}.nertags' .format (i )),
182182 output_file = os .path .join (data_path , '{}.txt' .format (i )))
183+ elif data_name == 'ontonotes5' :
184+ files_info = {'train' : 'train.txt' , 'valid' : 'dev.txt' , 'test' : 'test.txt' }
185+ if not os .path .exists (data_path ):
186+ raise ValueError ('please download Ontonotes5 from https://catalog.ldc.upenn.edu/LDC2013T19' )
187+ # os.makedirs(data_path, exist_ok=True)
188+ # os.system('wget -O {0}/data.tar.gz https://github.com/asahi417/neighbor-tagging/blob/master/data.tar.gz'.
189+ # format(CACHE_DIR))
190+ # os.system('tar -xzf {0}/data.tar.gz -C {0}'.format(CACHE_DIR))
191+ # for i in ['train', 'dev', 'test']:
192+ # conll_formatting(
193+ # file_token=os.path.join(CACHE_DIR, 'data/onto/{}.words'.format(i)),
194+ # file_tag=os.path.join(CACHE_DIR, 'data/onto/{}.ner'.format(i)),
195+ # output_file=os.path.join(data_path, '{}.txt'.format(i)))
183196 elif data_name == 'bc5cdr' :
184197 files_info = {'train' : 'train.txt' , 'valid' : 'dev.txt' , 'test' : 'test.txt' }
185198 if not os .path .exists (data_path ):
@@ -229,7 +242,6 @@ def convert_to_iob(path, export):
229242 convert_to_iob ('CDR_DevelopmentSet.PubTator.txt' , 'dev.txt' )
230243 convert_to_iob ('CDR_TestSet.PubTator.txt' , 'test.txt' )
231244 convert_to_iob ('CDR_TrainingSet.PubTator.txt' , 'train.txt' )
232-
233245 elif data_name == 'bionlp2004' : # https://www.aclweb.org/anthology/W04-1213.pdf
234246 files_info = {'train' : 'Genia4ERtask1.iob2' , 'valid' : 'Genia4EReval1.iob2' }
235247 if not os .path .exists (data_path ):
@@ -261,18 +273,6 @@ def convert_to_iob(path, export):
261273 os .system ('wget -O {0} https://groups.csail.mit.edu/sls/downloads/restaurant/restauranttest.bio' .format (
262274 os .path .join (data_path , 'valid.txt' )))
263275 entity_first = True
264- elif data_name == 'ontonotes5' :
265- files_info = {'train' : 'train.txt' , 'valid' : 'dev.txt' , 'test' : 'test.txt' }
266- if not os .path .exists (data_path ):
267- os .makedirs (data_path , exist_ok = True )
268- os .system ('wget -O {0}/data.tar.gz https://github.com/swiseman/neighbor-tagging/raw/master/data.tar.gz' .
269- format (CACHE_DIR ))
270- os .system ('tar -xzf {0}/data.tar.gz -C {0}' .format (CACHE_DIR ))
271- for i in ['train' , 'dev' , 'test' ]:
272- conll_formatting (
273- file_token = os .path .join (CACHE_DIR , 'data/onto/{}.words' .format (i )),
274- file_tag = os .path .join (CACHE_DIR , 'data/onto/{}.ner' .format (i )),
275- output_file = os .path .join (data_path , '{}.txt' .format (i )))
276276 elif data_name == 'mit_movie_trivia' :
277277 files_info = {'train' : 'train.txt' , 'valid' : 'valid.txt' }
278278 if not os .path .exists (data_path ):
0 commit comments