# Complex demo: Load Iris, preprocess (scale, encode), classify, evaluate, visualize
import pandas as pd
import numpy as np
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler, LabelEncoder
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score, confusion_matrix
from sklearn.decomposition import PCA
import matplotlib.pyplot as plt

def advanced_iris_preprocessing():
    # Load and clean
    iris = load_iris()
    df = pd.DataFrame(iris.data, columns=iris.feature_names)
    df['Target'] = iris.target
    df = df.dropna()
    
    # Preprocessing: Feature engineering
    df['Petal Ratio'] = df['petal length (cm)'] / (df['petal width (cm)'] + 1e-5)
    
    # Scale features
    scaler = StandardScaler()
    X_scaled = scaler.fit_transform(df.drop('Target', axis=1))
    df_scaled = pd.DataFrame(X_scaled, columns=df.drop('Target', axis=1).columns)
    df_scaled['Target'] = df['Target']
    
    # Encode target (if needed, here for demo)
    le = LabelEncoder()
    df_scaled['Target'] = le.fit_transform(df_scaled['Target'])
    
    # Split
    X = df_scaled.drop('Target', axis=1)
    y = df_scaled['Target']
    X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
    
    # Train and predict
    model = RandomForestClassifier(n_estimators=150, random_state=42)
    model.fit(X_train, y_train)
    y_pred = model.predict(X_test)
    
    # Evaluate
    acc = accuracy_score(y_test, y_pred)
    cm = confusion_matrix(y_test, y_pred)
    print(f"Accuracy: {acc:.2f}")
    print("Confusion Matrix:\n", cm)
    
    # Visualize with PCA
    pca = PCA(n_components=2)
    X_pca = pca.fit_transform(X)
    plt.scatter(X_pca[:, 0], X_pca[:, 1], c=y, cmap='viridis', alpha=0.6)
    plt.title('PCA of Preprocessed Iris Data')
    plt.xlabel('Principal Component 1')
    plt.ylabel('Principal Component 2')
    plt.annotate('Cluster Center', xy=(X_pca[:, 0].mean(), X_pca[:, 1].mean()), xytext=(1, 1), arrowprops=dict(facecolor='black', shrink=0.05))
    plt.show()

advanced_iris_preprocessing()