pplx-embed-v2-late built on Qwen3.5, keeps one 128d vector per token with MaxSim

tomaarsen · x · 2026-10-08

Technical details of pplx-embed-v2-late: built on Qwen3.5 with bidirectional attention, keeping one 128d vector per token. Retrieval uses MaxSim late interaction — each query token takes its best match score in the document, then scores are summed, so different parts of a query can match different parts of a page.

Natively supported in Sentence Transformers via model.similarity().

Related event: Perplexity Open-Sources Multimodal Embedding Models pplx-embed-v2-late(38 posts)→

Original post →

More from Models

Models channel →