Which component enables Transformers to focus on relevant parts of input sequences?
- Attention Mechanism
- Feed-Forward Networks
- Positional Encoding
- Layer Normalization
Answer: Attention Mechanism
Self-attention computes weighted relationships between tokens, enabling context-aware processing. Foundation of Transformer success.