SIFT lässt ein separates Sprachmodell Kandidaten vergleichen, bevor teure Benchmark-Tests beginnen, und prüft parallel neue Änderungen. Auf dem Polyglot-Benchmark erreichte ein Lauf 35,1 Prozent Genauigkeit in weniger als fünf Stunden, mit 42 CPU-Stunden und rund 150 Dollar API-Kosten.