Skip to content

fix: write ColBERT training TSV exports as UTF-8#283

Open
Solaris-star wants to merge 1 commit into
AnswerDotAI:mainfrom
Solaris-star:fix/268-utf8-training-export
Open

fix: write ColBERT training TSV exports as UTF-8#283
Solaris-star wants to merge 1 commit into
AnswerDotAI:mainfrom
Solaris-star:fix/268-utf8-training-export

Conversation

@Solaris-star

Copy link
Copy Markdown

Summary

TrainingDataProcessor.export_training_data opened the ColBERT training TSV files with the platform default encoding. On Windows that is often cp1252, which raises UnicodeEncodeError for characters such as Turkish ı (\u0131) during trainer.prepare_training_data().

Change

  • Open queries.train.colbert.tsv and corpus.train.colbert.tsv with encoding="utf-8".
  • Add a unit test that exports non-ASCII text and reads it back as UTF-8.

Test plan

  • Unit test test_export_training_data_writes_utf8 (no network)
  • Confirmed both open(...) call sites pass encoding="utf-8"

Fixes #268

Windows default locales (e.g. cp1252) raise UnicodeEncodeError on
non-ASCII query/corpus text in export_training_data. Always open the
TSV files with encoding="utf-8".

Fixes AnswerDotAI#268
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

UnicodeEncodeError in Windows

1 participant