# Advanced demo: Load iris dataset, clean, feature engineer, train classification, evaluate, visualize
import pandas as pd
import numpy as np
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score, confusion_matrix
from sklearn.datasets import load_iris
import matplotlib.pyplot as plt
from sklearn.decomposition import PCA

def advanced_classification_demo():
    # Load and clean
    iris = load_iris()
    df = pd.DataFrame(iris.data, columns=iris.feature_names)
    df['Target'] = iris.target
    df = df.dropna()
    # Feature engineering
    df['Petal Ratio'] = df['petal length (cm)'] / df['petal width (cm)']
    # PCA for visualization
    pca = PCA(n_components=2)
    df_pca = pd.DataFrame(pca.fit_transform(df.drop('Target', axis=1)), columns=['PC1', 'PC2'])
    df_pca['Target'] = df['Target']
    # Split
    X = df.drop('Target', axis=1)
    y = df['Target']
    X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
    # Train
    model = RandomForestClassifier(n_estimators=100, random_state=42)
    model.fit(X_train, y_train)
    # Predict and evaluate
    y_pred = model.predict(X_test)
    acc = accuracy_score(y_test, y_pred)
    cm = confusion_matrix(y_test, y_pred)
    print(f"Accuracy: {acc:.2f}")
    print("Confusion Matrix:\n", cm)
    # Visualize
    plt.scatter(df_pca['PC1'], df_pca['PC2'], c=df_pca['Target'], cmap='viridis')
    plt.title('PCA Visualization of Iris Classification')
    plt.xlabel('PC1')
    plt.ylabel('PC2')
    plt.annotate('Cluster Center', xy=(df_pca['PC1'].mean(), df_pca['PC2'].mean()), xytext=(df_pca['PC1'].mean() + 0.5, df_pca['PC2'].mean() + 0.5), arrowprops=dict(facecolor='black', shrink=0.05))
    plt.show()

advanced_classification_demo()