-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathprocess_lftk.py
More file actions
30 lines (23 loc) · 892 Bytes
/
Copy pathprocess_lftk.py
File metadata and controls
30 lines (23 loc) · 892 Bytes
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
import lftk
import spacy
import sys, os
from datasets import load_from_disk
dataset = sys.argv[1]
data = load_from_disk(dataset)
nlp = spacy.load("en_core_web_sm")
def extract_lftk(row, input_col, output_col):
text = row[input_col]
doc = nlp(text)
LFTK = lftk.Extractor(doc)
feats = LFTK.extract()
return {output_col: list(feats.values())}
if 'sentence1' in data['train'].column_names:
data = data.map(extract_lftk, num_proc=40,
fn_kwargs={'input_col': 'sentence1', 'output_col': 'sentence1_lftk'})
data = data.map(extract_lftk, num_proc=40,
fn_kwargs={'input_col': 'sentence2', 'output_col': 'sentence2_lftk'})
elif 'sentence' in data['train'].column_names:
data = data.map(extract_lftk, num_proc=40,
fn_kwargs={'input_col': 'sentence', 'output_col': 'sentence_lftk'})
print(data)
data.save_to_disk(dataset)