|
1 | | -from torchglyph.datasets.sequential_labeling import CoNLL2000Chunking, CoNLL2003NER |
| 1 | +from torchglyph.datasets import CoNLL2000Chunking, CoNLL2003NER |
| 2 | +from torchglyph.datasets import SemEval2010T1NERCatalan, SemEval2010T1NERSpanish |
2 | 3 |
|
3 | 4 |
|
4 | | -def test_conll2000_chunking() -> None: |
5 | | - train, test = CoNLL2000Chunking.new(batch_size=1, word_dim=None) |
6 | | - assert len(train) == 8936 |
7 | | - assert len(test) == 2012 |
| 5 | +def test_conll2000_chunking(): |
| 6 | + train, test = CoNLL2000Chunking.new(batch_size=1, word_dim=None, remove_missing=True) |
| 7 | + assert len(train.dataset) == 8936 |
| 8 | + assert len(test.dataset) == 2012 |
8 | 9 |
|
9 | 10 |
|
10 | | -def test_conll2003_ner() -> None: |
11 | | - train, dev, test = CoNLL2003NER.new(batch_size=1, word_dim=None) |
12 | | - assert len(train) == 14987 |
13 | | - assert len(dev) == 3466 |
14 | | - assert len(test) == 3684 |
| 11 | +def test_conll2003_ner(): |
| 12 | + train, dev, test = CoNLL2003NER.new(batch_size=1, word_dim=None, remove_missing=True) |
| 13 | + assert len(train.dataset) == 14987 |
| 14 | + assert len(dev.dataset) == 3466 |
| 15 | + assert len(test.dataset) == 3684 |
| 16 | + |
| 17 | + |
| 18 | +def test_semeval2010_catalan(): |
| 19 | + train, dev, test = SemEval2010T1NERCatalan.new(batch_size=1, word_dim=None, remove_missing=True) |
| 20 | + assert len(train.dataset) == 8709 |
| 21 | + assert len(dev.dataset) == 1445 |
| 22 | + assert len(test.dataset) == 1698 |
| 23 | + |
| 24 | + |
| 25 | +def test_semeval2010_spanish(): |
| 26 | + train, dev, test = SemEval2010T1NERSpanish.new(batch_size=1, word_dim=None, remove_missing=True) |
| 27 | + assert len(train.dataset) == 9022 |
| 28 | + assert len(dev.dataset) == 1419 |
| 29 | + assert len(test.dataset) == 1705 |
0 commit comments