# Complex demo: Load Iris, split with train_test_split and StratifiedKFold, classify, evaluate, visualize confusion matrix
import pandas as pd
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split, StratifiedKFold, cross_val_score
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score, confusion_matrix
from sklearn.preprocessing import StandardScaler
import matplotlib.pyplot as plt
import seaborn as sns
import numpy as np

def advanced_splitting_demo():
    # Load and prep
    iris = load_iris()
    df = pd.DataFrame(iris.data, columns=iris.feature_names)
    df['Target'] = iris.target
    X = df.drop('Target', axis=1)
    y = df['Target']
    # Scale
    scaler = StandardScaler()
    X_scaled = scaler.fit_transform(X)
    # Train_test_split
    X_train, X_test, y_train, y_test = train_test_split(X_scaled, y, test_size=0.3, random_state=42, stratify=y)
    # Train and predict
    model = RandomForestClassifier(n_estimators=100, random_state=42)
    model.fit(X_train, y_train)
    y_pred = model.predict(X_test)
    acc = accuracy_score(y_test, y_pred)
    cm = confusion_matrix(y_test, y_pred)
    print(f"Accuracy with train_test_split: {acc:.2f}")
    print("Confusion Matrix:\n", cm)
    # StratifiedKFold cross-validation
    skf = StratifiedKFold(n_splits=5)
    cv_scores = cross_val_score(model, X_scaled, y, cv=skf)
    print(f"Cross-Validation Scores: {cv_scores}")
    print(f"Mean CV Score: {np.mean(cv_scores):.2f}")
    # Visualize confusion matrix
    sns.heatmap(cm, annot=True, cmap='Blues', fmt='d')
    plt.title('Confusion Matrix for Iris Splitting')
    plt.xlabel('Predicted')
    plt.ylabel('True')
    plt.annotate('High Accuracy', xy=(1.5, 0.5), xytext=(2.5, 1.5), arrowprops=dict(facecolor='black', shrink=0.05))
    plt.show()

advanced_splitting_demo()