# Complex demo: Load Iris dataset, clean, feature engineer, classify, evaluate, visualize
import pandas as pd
import numpy as np
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score, confusion_matrix
from sklearn.decomposition import PCA
import matplotlib.pyplot as plt

def advanced_iris_demo():
    # Load and clean
    iris = load_iris()
    df = pd.DataFrame(iris.data, columns=iris.feature_names)
    df['Target'] = iris.target
    df = df.dropna()  # Ensure no missing values
    # Feature engineering
    df['Petal Ratio'] = df['petal length (cm)'] / (df['petal width (cm)'] + 1e-5)  # Avoid division by zero
    df['Sepal Area'] = df['sepal length (cm)'] * df['sepal width (cm)']
    # Split
    X = df.drop('Target', axis=1)
    y = df['Target']
    X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
    # Train and predict
    model = RandomForestClassifier(n_estimators=150, random_state=42)
    model.fit(X_train, y_train)
    y_pred = model.predict(X_test)
    # Evaluate
    acc = accuracy_score(y_test, y_pred)
    cm = confusion_matrix(y_test, y_pred)
    print(f"Classification Accuracy: {acc:.2f}")
    print("Confusion Matrix:\n", cm)
    # Visualize with PCA
    pca = PCA(n_components=2)
    X_pca = pca.fit_transform(X)
    plt.scatter(X_pca[:, 0], X_pca[:, 1], c=y, cmap='viridis', alpha=0.6)
    plt.title('PCA Visualization of Iris Dataset')
    plt.xlabel('Principal Component 1')
    plt.ylabel('Principal Component 2')
    plt.annotate('Cluster Center', xy=(X_pca[:, 0].mean(), X_pca[:, 1].mean()), xytext=(1, 1), arrowprops=dict(facecolor='black', shrink=0.05))
    plt.show()

advanced_iris_demo()