Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited

Apply to this job
San Francisco Bay Area, US Until 8/21/2026 First posted April 25, 2026 Last posted April 25, 2026
Job description

We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.

 

Responsibilities:

  • Integrate vision encoders and audio-native models into core agent reasoning loops.
  • Optimize streaming latency for voice-to-voice AI interactions.
  • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.

Qualifications:

  • Experience with Whisper, CLIP, and multimodal LLM integration.
  • Knowledge of streaming architectures and WebRTC.
  • Expertise in cross-modal alignment.
About this role

Summary

Develop and optimize multimodal AI systems integrating vision and audio models.

Job title

Multimodal AI Systems Architect (AI Engineering)

Experience level

Industry

software

Location requirements

San Francisco Bay Area, USA, on-site preferred

Salary

Not specified

Management role

No

Skills & keywords

Required skills

WhisperCLIPmultimodal LLMstreaming architecturesWebRTCcross-modal alignment

Preferred skills

WhisperCLIPmultimodal LLMstreaming architecturesWebRTCcross-modal alignment

Specializations

AI engineeringmultimodal systemsaudio-visual
Locations

Structured locations inferred from the posting.

Unknown location

On-site