| import os
|
| from sentence_transformers import SentenceTransformer
|
| from pathlib import Path
|
| import numpy as np
|
| import logging
|
|
|
|
|
| os.environ["KMP_DUPLICATE_LIB_OK"] = "TRUE"
|
| logging.basicConfig(level=logging.INFO)
|
|
|
| def main():
|
| try:
|
|
|
| logging.info("Chargement du modèle...")
|
| model = SentenceTransformer('paraphrase-MiniLM-L6-v2')
|
|
|
|
|
| logging.info("Lecture des documents...")
|
| docs = []
|
| for file in Path('input').glob('*.html'):
|
| with open(file, 'r', encoding='utf-8') as f:
|
| docs.append(f.read())
|
|
|
|
|
| logging.info("Création des embeddings...")
|
| embeddings = model.encode(docs, show_progress_bar=True)
|
|
|
|
|
| np.save('output/embeddings.npy', embeddings)
|
| logging.info(f"Terminé ! Résultats sauvegardés dans output/")
|
|
|
| except Exception as e:
|
| logging.error(f"Erreur : {str(e)}")
|
|
|
| if __name__ == "__main__":
|
| main() |