{"tasks":[{"slug":"c6-suggest-scenario-measures","scope":"exploratory","geography":"Multiple cities","phase":3,"family":"policy","scores":[{"slug":"gpt5","value":82.964,"skill":null,"n_valid":50,"name":"GPT-5.5","display":"82.964","protocol":"GPT-5.5","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"gemini","value":73.784,"skill":null,"n_valid":50,"name":"Gemini 2.5 Pro","display":"73.784","protocol":"Gemini 2.5 Pro","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"kimi","value":70.532,"skill":null,"n_valid":50,"name":"Kimi 2.6","display":"70.532","protocol":"Kimi 2.6","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"gemma","value":55.024,"skill":null,"n_valid":50,"name":"Gemma-4-26B (API, temp 0)","display":"55.024","protocol":"Gemma-4-26B (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"llama","value":null,"skill":null,"n_valid":0,"name":"llama (API, temp 0)","display":null,"protocol":"llama (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"gptoss","value":null,"skill":null,"n_valid":0,"name":"gptoss (API, temp 0)","display":null,"protocol":"gptoss (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"glm53","value":null,"skill":null,"n_valid":0,"name":"glm53 (API, temp 0)","display":null,"protocol":"glm53 (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"minimax3","value":null,"skill":null,"n_valid":0,"name":"minimax3 (API, temp 0)","display":null,"protocol":"minimax3 (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"qwen","value":null,"skill":null,"n_valid":0,"name":"qwen (API, temp 0)","display":null,"protocol":"qwen (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"},{"slug":"deepseek","value":null,"skill":null,"n_valid":0,"name":"deepseek (API, temp 0)","display":null,"protocol":"deepseek (API, temp 0)","url":"/tasks/c6-suggest-scenario-measures"}],"n_items":50,"n_test":50,"metric":"LLM judge rating / 100","higher":true,"unit":"","baseline":null,"baseline_display":null,"source":"Five-axis LLM rubric; no measured reference outcome","url":"/tasks/c6-suggest-scenario-measures","version":"historical","human":null,"best":{"slug":"gpt5","value":82.964,"skill":null,"n_valid":50,"name":"GPT-5.5","display":"82.964","protocol":"GPT-5.5","url":"/tasks/c6-suggest-scenario-measures"},"leaders":[{"slug":"gpt5","value":82.964,"skill":null,"n_valid":50,"name":"GPT-5.5","display":"82.964","protocol":"GPT-5.5","url":"/tasks/c6-suggest-scenario-measures"}],"status":"evaluated","title":"Suggest a package of measures to reach a city-scale goal"}],"aggregation":"Per task and version only; no cross-task average"}