INNER CODE UNIT · Python
main
NishkarshRaj/100DaysofMLCode · 8_Natural_Language_Processing/natural_language_processing.py:16
def main():
# Importing the dataset
dataset = pd.read_csv('Restaurant_Reviews.tsv', delimiter='\t', quoting=3)
# Cleaning the texts
nltk.download('stopwords')
corpus = []
for i in range(0, 1000):
review = re.sub('[^a-zA-Z]', ' ', dataset['Review'][i])
review = review.lower()
review = review.split()
ps = PorterStemmer()
review = [ps.stem(word) for word in review if not word in set(stopwords.words('english'))]
review = ' '.join(review)
corpus.append(review)
# Creating the Bag of Words model