mirror of
https://github.com/modelscope/modelscope.git
synced 2026-09-02 03:59:31 +02:00
Fix encoding for Windows (#712)
he proposed fix involves converting the encoding format from Windows-1250 to utf-8. This is in response to the issues reported when running Anytext: tyxsspa/AnyText#45 tyxsspa/AnyText#36 tyxsspa/AnyText#22
This commit is contained in:
@@ -52,12 +52,12 @@ class TranslationPipeline(Pipeline):
|
||||
self._src_vocab_path = osp.join(
|
||||
model, self.cfg['dataset']['src_vocab']['file'])
|
||||
self._src_vocab = dict([
|
||||
(w.strip(), i) for i, w in enumerate(open(self._src_vocab_path))
|
||||
(w.strip(), i) for i, w in enumerate(open(self._src_vocab_path, encoding='utf-8'))
|
||||
])
|
||||
self._trg_vocab_path = osp.join(
|
||||
model, self.cfg['dataset']['trg_vocab']['file'])
|
||||
self._trg_rvocab = dict([
|
||||
(i, w.strip()) for i, w in enumerate(open(self._trg_vocab_path))
|
||||
(i, w.strip()) for i, w in enumerate(open(self._trg_vocab_path, encoding='utf-8'))
|
||||
])
|
||||
|
||||
tf_config = tf.ConfigProto(allow_soft_placement=True)
|
||||
@@ -81,7 +81,7 @@ class TranslationPipeline(Pipeline):
|
||||
self._tok = MosesTokenizer(lang=self._src_lang)
|
||||
self._detok = MosesDetokenizer(lang=self._tgt_lang)
|
||||
|
||||
self._bpe = apply_bpe.BPE(open(self._src_bpe_path))
|
||||
self._bpe = apply_bpe.BPE(open(self._src_bpe_path, encoding='utf-8'))
|
||||
|
||||
# model
|
||||
output = self.model(self.input_wids)
|
||||
|
||||
Reference in New Issue
Block a user